您现在的位置是:首页 > seo城市导航分站 > 长沙seo > 长沙seo

长沙seo使用Robots.txt引导百度爬虫合理分配抓取资源

安心seo 2021-09-17 01:07:26 网站优化 人已围观

简介我所在的网站算是一个大型网站,百度收录3000万,每天百度爬虫抓取总次数在500w次左右,单页的百度收录率 80%,看起来已经是一个相当不错的数据,但分析一下详细的日志文件,还是

我所在的网站算是一个大型网站,百度收录3000万,每天百度爬虫抓取总次数在500w次左右,单页的百度收录率 80%,看起来已经是一个相当不错的数据,但分析一下详细的日志文件,还是可以发现一些问题,

1.大型网站的列表页为了方便用户查找所需信息,通常会设置多重的筛选条件(Facet Navigation),但爬虫并没有智能到可以自主判断哪些条件可以组合,哪些条件组合起来没有意义,只要在代码里面有链接就会去抓取,导致百度爬虫耗费了大量资源在列表筛选页上。分析了一个月的数据,发现百度的抓取量有30%消耗在列表页,但是列表页带来的百度自然流量仅占所有百度自然流量的2%,所以对网站的列表页来说,爬虫的投入产出非常低。

2.重复抓取现象严重。 我个人觉得,对网站来说,只被爬虫抓取过1次的页面(Distinct Crawl)最有价值,因为对一张本身内容质量还可以的页面来说,只要被抓取过一次,收录的几率就超过80%。如果页面本身质量不行,即使被抓取过几十次,也依然不会被收录。 继续分析我们网站的数据,发现在百度爬虫一天500w的抓取中,有超过一半的抓取是对相同页面的多次抓取,如果能把这些重复的抓取转移到那些一次都没被抓过的页面上,对网站的价值无疑更大。

如何解决这两个问题?

先说第一个,针对筛选页消耗爬虫资源问题,很多人都建议使用nofollow标签告诉爬虫,不要继续给这些页面分配权重,我们也这么做过。但事实证明百度爬虫对nofollow并不敏感,使用之后爬虫依旧疯狂抓取,同时也没有把权重从筛选页面上转移到规范页面上。

无奈之下,我们只好考虑起用SEO的大杀器:Robots文件,把所有的筛选页面全部disallow掉,之前没有使用robots禁止抓取的原因是担心万一爬虫被禁止抓取列表后,会不会其他的页面也不抓了?毕竟列表筛选页还是会给单页贡献大量入口,但基于我们网站单页收录还不错的现状,还是决定尝试一下。

事实证明,效果非常明显,新版的robots上线三天后,列表页的爬虫抓取量下降到15%;同时之前担心的问题也没有发生,爬虫的抓取总量不但没有下降,反而增长了10%左右,单页的抓取量也上升了20%,可以算是达到了我们的预期目标:把列表页浪费的爬虫资源转移到其他需要被抓取的页面上。

但是如何证明抓取资源是被转移到需要被抓取的页面上呢,这正好也是之前提到的第二个问题,我们看了唯一抓取率( 只抓一次的页面数/总抓取数)的变化,从50%增长到74%,可以说明爬虫在阅读robots文件后,对爬虫资源做了更合理的分配,更多的单页被抓取。

总结:Robots文件相比其他手段,可以在较短时间内优化百度爬虫的抓取资源分配,但这得建立在网站本身结构良好,内容过关的基础之上,同时最重要的还是得反复测试,通过日志分析实际情况来调整以取得最佳效果 转自百度站长社区


使用Robots.txt引导百度爬虫合理分配抓取资源的相关文章

优选十个SEO必备网站排名优化推广网站
做SEO经常需要一些网站优化工具的辅助,比如网站关键词排名优化、外链发布平台和网站收录查询等各类工具,以便节省时间,让SEO变得更加轻松。那么,常用的SEO工具都有哪些呢?本期精选了十款网站优化推广工具网站,希望对大家的SEO工作有所帮助。 优选十个SEO必备网站排名优化推广网站 1.爱站 爱站网站长工具提供网站收录查询和站长查询以及百度权重值查询等多...

完整的企业网站搜狗seo优化方案
完整的企业网站搜狗seo优化方案   其实对我个人来讲,并不喜欢优化企业网站,为什么呢,因为没有效果,不是排名上不去,而是上去排名了,也没有多大效果,而实际上大多数需要优化的站点都是企业网站,那么小编也给大家出一套正规企业网站搜狗seo优化的方案,这套方案几乎适合任意企业站点。   在做出这么一套方案之前,这几个观点希望大家能够意...

网站seo优化的十种作弊方法你知道吗
网站seo优化的十种作弊方法你知道吗     网站seo优化作弊意味着很多,但作为一个建筑工地并不是一种正常的SEO技术。同时也不受百度青睐,百度被列入SEO黑帽类。seo优化不推荐使用这种技术在建设网站的过程中。     1、关键词堆积     seo优化也就是说,页面上出现了大量关键词,即SEO培训中提到的关键词叠加。关于关键词密度SEO界限也没有...

很赞哦! ()

根据您查看的使用Robots.txt引导百度爬虫合理分配抓取资源猜你喜欢

站点信息

  • 建站时间:2019年05月06日
  • 网站名称:安心SEO
  • 服务内容:网站优化、店铺运营
  • 文章统计:1300 篇
  • 工具分享:8 篇
  • 您是本站第:2509897位客人!