• 伊朗终结亚洲球队16场不胜 力压西葡小组第一 2019-07-05
  • 清明五一假期将至 韩国酒店为迎中国游客各出奇招 2019-07-03
  • 端午小长假,恒大绿洲“购房节”福利大“放价”! 2019-07-03
  • “甜蜜定制交友”究竟是什么货色? 2019-07-01
  • 人的本质是利或为利。 2019-07-01
  • 郝龙斌:台湾经济最大难题不是经济 关键在民粹 2019-06-17
  • 上海合作组织青岛峰会举行 习近平主持会议并发表重要讲话 2019-06-07
  • 第七届云台会签约协议金额96亿元 2019-06-06
  • 为何“最美晚霞”总在暴雨后? 2019-05-30
  • 第七届中俄蒙美食文化节将于7月17日在乌兰察布市开幕 2019-05-11
  • 上海90家定点医疗机构将受医保常规检查 2019-05-09
  • 互联网电视,谁来填补乐视之空? 2019-05-07
  • 【学习时刻】农大校长柯炳生:推进农业供给侧改革,夯实“固本安民之要” 2019-05-07
  • 黄淳的专栏作者中国国家地理网 2019-05-06
  • 社会主义社会按劳分配是建立在公有制和私有制并存基础上的,共产主义社会按需分配是建立在公有制基础上的,所有制基础不同,其分配形式也就不同。所谓“共产主义... 2019-05-06
  • 深圳互联网供应商--贝尔利科技
    深圳网站建设、 网站设计、网站改版首选贝尔利深圳网站建设公司
    广西快3直播
    • 联系电话:135-9036-6521
      值班电话:135-9036-6521
    • 建站咨询
      点击我留言
    • 推广咨询
      点击我留言

    解析搜索引擎蜘蛛的爬行和抓取页面的原理

    广西快3直播 www.adi20.com 2018-08-13 06:44:01??文章来源:广西快3直播??责任编辑:Addrion

      “搜索引擎蜘蛛”这个词相信很多人都有点陌生,其实他的意思就是在搜索引擎系统中又被称之为“蜘蛛”或“机器人”,是用来爬行和访问页面的程序。

      今天,广西快3直播贝尔利科技小编就来和大家分享下搜索引擎蜘蛛的爬行和抓取页面的原理。希望对大家有所帮助。
      一、搜索引擎蜘蛛简介
      搜索引擎蜘蛛,在搜索引擎系统中又被称之为“蜘蛛”或“机器人”,是用来爬行和访问页面的程序。
     ?、?爬行原理
      搜索引擎蜘蛛访问网页的过程,就好比用户使用的浏览器。
      搜索引擎蜘蛛向页面发出访问请求,该页面的服务器则返回该页面的HTML代码。
      搜索引擎蜘蛛将收到的HTML代码存入搜索引擎的原始页面数据库中。
     ?、?如何爬行
      为了提高搜索引擎蜘蛛的工作效率,通常采用多个蜘蛛并发分布爬行。
      同时,分布爬行还分为两种模式:深度优先和广度优先。
      深度优先:沿着发现的链接一直爬行,直到没有任何链接。
      广度优先:先这一页面上的所有链接爬行完毕之后,才会沿着第二层页面继续这样爬行。
     ?、?蜘蛛必遵守的协议
      搜索引擎蜘蛛在访问网站之前,都会先访问网站根目录下的robots.txt文件。
      搜索引擎蜘蛛不会去抓取robots.txt文件中禁止爬行的文件或目录。
     ?、?常见搜索引擎蜘蛛
      百度蜘蛛:Baiduspider
      谷歌蜘蛛:Googlebot
      360蜘蛛:360Spider
      SOSO蜘蛛:Sosospider
      有道蜘蛛:YoudaoBot,YodaoBot
      搜狗蜘蛛:Sogou News Spider
      必应蜘蛛:bingbot
      Alexa蜘蛛:ia_archiver
      二、如何吸引更多搜索引擎蜘蛛
      互联网信息爆炸,搜索引擎蜘蛛不可能将所有网站的所有链接全部爬行到,那么如何吸引更多的搜索引擎蜘蛛到我们网站上来爬行变得非常重要。
     ?、?导入链接
      无论是外部链接,还是内部链接,只有有导入,才能被搜索引擎蜘蛛知道该页面的存在。所以,多多做外链建设有助于吸引更多蜘蛛来访。
     ?、?页面更新频率
      页面更新频率越高,搜索引擎蜘蛛来访的次数也会越多。
     ?、?网站和页面权重
      整个网站的权重以及某一页面的权重(包括首页也是页面)影响着蜘蛛的来访频率,权重高、权威性强的网站一般都会增加搜索引擎蜘蛛的好感。
     ?、?与首页的距离
      首页>一级目录>二级目录>三级目录>四级目录…很显然,目录越深蜘蛛来访的几率和次数就会越少,因为一般外链都是指向首页的,首页再向下爬行,只会越来越少。
      这里给大家的建议是,做外链的时候,不要只做首页外链,偶尔做一做栏目和聚合页面的外链也还是不错的哦~
      有些时候,URL短,蜘蛛可能也会觉得这个链接的权重哦,所以,最好只做一级栏目,然后就是文章页面。
      三、搜索引擎蜘蛛地址库
      搜索引擎蜘蛛有一个专门的地址库,用来存放已经被发现的URL(已被抓取和未被抓取的都算,只要是被发现的URL都算),这样就不会出现重复爬行和抓取页面的情况了。
     ?、?地址库URL来源
      蜘蛛抓取的页面中发现的新的URL;
      站长后台自主提交的URL;
      站长后台提交的XML地图中的URL;
      站长后台提交的网站URL;
     ?、?对于未被抓取的URL
      对于未被抓取的URL,不管是以什么方式获取的,哪怕是搜索引擎蜘蛛自己发现的,也会先放入地址库中,然后在做统一抓取。
      四、页面数据存储
      搜索引擎蜘蛛将抓取的页面数据会存入搜索引擎的原始页面数据库中,其实,就可以理解为快照中看到的页面数据,和用户看到的是一样的,每一个页面的URL地址都有一个唯一的编号。
      五、复制内容检测
      搜索引擎蜘蛛在爬行的过程中,会进行一定程度的复制内容检测。如果是权重低的网站上,发现了大量的转载或抄袭内容时,可能会停止爬行,这些页面可能也会不抓取与收录。
      但并不是说网站就不能转载,像一些权重很高的平台,哪怕是转载了一篇旧闻排名也可以很好,因为搜索引擎蜘蛛可能会觉得,就算是旧闻可能也是高质量的吧。
      以上这些内容就是今天贝尔利科技小编要和大家分享的内容。感谢大家的阅读!
    责任编辑:Addrion
    ?
  • 伊朗终结亚洲球队16场不胜 力压西葡小组第一 2019-07-05
  • 清明五一假期将至 韩国酒店为迎中国游客各出奇招 2019-07-03
  • 端午小长假,恒大绿洲“购房节”福利大“放价”! 2019-07-03
  • “甜蜜定制交友”究竟是什么货色? 2019-07-01
  • 人的本质是利或为利。 2019-07-01
  • 郝龙斌:台湾经济最大难题不是经济 关键在民粹 2019-06-17
  • 上海合作组织青岛峰会举行 习近平主持会议并发表重要讲话 2019-06-07
  • 第七届云台会签约协议金额96亿元 2019-06-06
  • 为何“最美晚霞”总在暴雨后? 2019-05-30
  • 第七届中俄蒙美食文化节将于7月17日在乌兰察布市开幕 2019-05-11
  • 上海90家定点医疗机构将受医保常规检查 2019-05-09
  • 互联网电视,谁来填补乐视之空? 2019-05-07
  • 【学习时刻】农大校长柯炳生:推进农业供给侧改革,夯实“固本安民之要” 2019-05-07
  • 黄淳的专栏作者中国国家地理网 2019-05-06
  • 社会主义社会按劳分配是建立在公有制和私有制并存基础上的,共产主义社会按需分配是建立在公有制基础上的,所有制基础不同,其分配形式也就不同。所谓“共产主义... 2019-05-06
  • 三分赛车开奖数据分析 一起来捉妖哪个妖精好 李小冉逆水寒 宙斯古代财富试玩 刀塔自走棋组合 pc蛋蛋计划表预测 湖北快三选号口诀 北京赛车计划人工 cf手游ak青花瓷属性 搜索体育彩票走势图 35选7开奖结果2014049 篮球巨星豪华版官网 竞彩微信投注 以太币价格走势 澳门赌场有龙虎吗 七乐彩走势图前1500期