百度网页收录问题初步解读
2012-03-28 14:48:46

百度的网页收录问题被大家所关注,但是却也有很多人没有认真去读百度的官方宣言。而从百度官方的网页收录问题解答中,我们可以摸索到百度收录网址站的基本脉络。既然是要做网站的,又要推广的,先不谈什么技巧,百度的基本规定是要了解的。

  1. 如何让我的网站(独立网站或者blog)被百度收录?
    • 百度会收录符合用户搜索体验的网站和网页。
    • 为促使百度Spider更快的发现您的站点,您也可以向我们提交一下您的网站的入口网址。提交地址是:http://www.baidu.com/search/url_submit.html。您只需提交首页即可,无需提交详细的内容页面。
    • 百度的网页收录机制,只和网页价值有关,与百度推广等商业因素没有任何关联。

      这里有一个关键词:用户搜索体验。很多站长在这方面下的功夫很少,只在表面的技巧方面做文章,本末倒置了。但是在技巧方面做文章也是眼前的省力,确实缺乏长远眼光的。


     
  2. 如何查看我的网站是否被百度收录?site语法看到的结果数是不是收录的真实数量?
    • 百度是否已经收录您的网站可以通过执行site语法查看,直接在百度搜索中输入site:您的域名,如site:www.baidu.com,如果可以查询到结果,那您的网站就已经被百度收录。
    • site语法得到的搜索结果数,只是一个估算的数值,仅供参考。
    • 如需查询相对准确的收录量,请使用百度统计的收录量查询功能。

      这里的问题就比较明白了,使用site命令,就可以了解网站被收录的数量及时间,用法也说了,就像这样:site:www.someabc.com ,就OK了。



     
  3. 如何让我的网页不被百度收录?
    • 百度严格遵循搜索引擎Robots协议(详细内容,参见http://www.robotstxt.org/)。
    • 您可以设置一个Robots文件以限制您的网站全部网页或者部分目录下网页不被百度收录。具体写法,参见:如何撰写Robots文件
    • 如果您的网站在被百度收录之后才设置Robots文件禁止抓取,那么新的Robots文件通常会在48小时内生效,生效以后的新网页,将不再建入索引。需要注意的是,robots.txt禁止收录以前百度已收录的内容,从搜索结果中去除可能需要数月的时间。
    • 如果您的拒绝被收录需求非常急迫,可以在投诉中心反馈,我们会尽快处理。

      这是比较少见的情况,但是在某些情况下也是客户所需要的,所以robots机制提供这样的可能。写一条指令进去,禁止蜘蛛爬行就能保证你的网站不被百度收录。


     
  4. 为什么我的网站内一些不设链接的私密性网页,甚至是需要访问权限的网页,也会被百度收录?
    • Baiduspider对网页的抓取,是通过网页与网页之间的链接实现的。
    • 网页之间的链接类型,除了站点内部的页面链接之外,还有不同网站之间的互相链接。因此,某些网页即便通过您的网站内部链接无法访问到,但是,如果别人的网站上有指向这些页面的链接,那么这些页面还是会被搜索引擎所收录。
    • 百度Spider的访问权限,和普通用户是一样的。因此,普通用户没有权限访问的内容,Spider也没有权限访问。之所以看上去某些访问权限限制内容被百度收录,原因有两点:
        A. 该内容在Spider访问时是没有权限限制的,但抓取之后,内容的权限发生了变化
        B. 该内容有权限限制,但是由于网站安全漏洞问题,导致用户可以通过某些特殊路径直接访问。而一旦这样的路径被公布在互联网上,则Spider就会循着这条路径抓出受限内容
    • 如果您不希望这些私密性内容被百度收录,一方面可以通过Robots协议加以限制;另一方面,也可以通过投诉中心反馈给我们进行解决。

      百度蜘蛛就像一位普通的用户一样,只要是对公众开放的网页都可以抓取。上面的情况烈得很明细,如果不想让别人看到,一方面可以robots禁止,另一方面是对普通访问者设置权限,无权限者自然无法访问,百度蜘蛛也同样无法抓取。


     
  5. 为什么我的网站收录数量越来越少?
    • 您的网站所在的服务器不稳定,Baiduspider在检查更新时抓取不到网页而被暂时去除。
    • 您的网站不符合用户的搜索体验。

      这两条,第一条没什么可说的,硬件不好必然会受到蜘蛛的反感。第二条,是搜索引擎极力建议站长要做的,仔细领会吧。


     
  6. 我的网页为什么会从百度搜索结果中消失?
    • 百度并不允诺所有网页都可从百度搜索到。
    • 如果您的网页长时间无法从百度搜索到,或者突然从百度的搜索结果中消失,可能的原因有:
      A. 您的网页不符合用户的搜索体验
      B. 您的网站所在服务器不稳定,被百度暂时性去除,稳定之后,问题会得到解决
      C. 您的网页内容有不符合国家法律和法规规定的地方
      D. 其他技术性问题
    • 以下的说法是错误的和毫无根据的:
      A. 参与了百度推广但未续费,会从百度搜索结果中消失
      B. 参与了其他搜索引擎的广告项目,会从百度搜索结果中消失
      C. 与百度旗下网站产生了竞争,会从百度搜索结果中消失
      D. 从百度获得的流量太大,会从百度搜索结果中消失

      看看上面百度辟谣的部分,是很精彩的,这些说法在广大的站长中很有市场。而在某些情况下,及时否认也是存在的,不过我相信长远看来,这不是目标,只是发展的阶段而已。


     
  7. 什么样的网页会被百度认为是没有价值而不被百度收录或者从现有搜索结果中消失?
    • 百度只收录对用户有价值的网页。任何网页在搜索结果中的去留变化,都是机器算法计算和调整的结果。下述类型的网页,百度明确不会欢迎:
      A.网页做了很多针对搜索引擎而非用户的处理,使得用户从搜索结果中看到的内容与页面实际内容完全不同,或者使得网页在搜索结果中获得了不恰当的排名,从而导致用户产生受欺骗感觉。
      如果您的网站中有较多这种页面,那么这可能会使您的整个网站的页面收录和排序受到影响。
      B. 网页是复制自互联网上的高度重复性的内容。
      C. 网页中有不符合中国法律和法规的内容。

      高度重复性的内容是蜘蛛最厌恶的,而互联网上的采集之风往往与此相对立。所以,很多人在努力地做原创,但是发现原创很辛苦,所以有些人就退而求其次,作伪原创。还是踏踏实实的做真原创为好。


  8. 如果我的网站因为作弊行为而从百度搜索结果中消失,是否还有被重新收录可能?
    • 凡是作出完全修正的网站,都有机会被百度重新收录。百度会定期对被处理站点进行自动评估,并对符合条件者重新收录。
    • 需要说明的是,百度技术和产品部门只对用户搜索体验负责。以下的说法都是错误的和毫无根据的:
      A. 我成为百度的广告客户或者联盟网站,就可以重新被收录
      B. 我给百度若干钞票,就可以重新被收录
      C. 我认识百度的某某人,就可以重新被收录

      理论上来说当然可以,而现实和理论毕竟差距明显,所以别寄希望于百度的重新收录,在受到惩罚之前,认认真真的做站吧。


  9. 我的网站更新了,可是百度收录的内容还没更新怎么办?
    • 百度会定期自动更新所有网页(包括去除死链接,更新域名变化,更新内容变化)。因此请耐心等一段时间,您的网站上的变化就会被百度察觉并修正。

      有的网站内容可以做到秒收,但有的网站却是长时间没有动静,记住:百度希望勤奋的站长,经常有新内容出来,百度蜘蛛也会希望经常光顾的。


     
  10. 为什么我的网站在百度收录的数量和其他搜索引擎相比相差很多?
    • 通常情况下,这是正常的现象,不同的搜索引擎判断网页价值的算法不同。

      不要用别人的标准来要求百度,这样对百度不公平,当然对其他搜索引擎也不公平。