新闻中心News Center
  • 正确利用robots文件,引导蜘蛛抓取页面
  •         由于百度蜘蛛抓取网页的精力是有限的,每次来抓取网站,不会把网站所有文章、所有页面一次性全部抓取,尤其是当网站的内容越来越多时,蜘蛛每次只能抓取一部分。这个时候我们应该利用robots文件来引导蜘蛛最先抓取优质的页面。

            一些小型网站可以不做robots,但是对于中大型网站来说,robots文件尤为重要,因为这些网站数据库非常庞大,蜘蛛来时,要像对待好朋友一样给它看最重要的东西,因为这个朋友精力有限,每次来都不能把所有的东西看一遍,所以就需要robots文件屏蔽一些无关紧要的东西。由于种种原因,某些文件不想被搜索引擎抓取,如处于隐私保护的内容,也可以用robots文件把搜索引擎屏蔽。robots文件的格式一定要正确。下面我们一起来了解robots文件的用法:

            1、"user-agent:*disallow:/"表示"禁止所有搜索引擎访问网站的任何部分",这相当于该网站在搜索引擎里没有记录,也就谈不上排名。

            2、"user-agent:*disallow:"表示"允许所有的robots访问",即允许蜘蛛任意抓取并收录该网站。这里需要注意,前两条语法之间只相差一个"/"。

            3、"user-agent:badbot disallow:/"表示"禁止某个搜索引擎的访问"。


            4、"user-agent:baiduspider disallow:user-agent:*disallow:/"表示"允许某个搜索引擎的访问"。这里面的"baiduspider"是百度蜘蛛的名称,这条语法即是允许百度抓取该网站,而不允许其他搜索引擎抓取。

            使用robots文件应该注意在不确定文件格式怎么写之前,可以先新建一个文本文档,注意robots文件名必须是robots.txt,其后缀是txt并且是小写的,不可以随便更改,否则搜索引擎识别不了。然后打开该文件,可以直接复制粘贴别人的格式,

            robots文件写法一定要规范,格式是一条命令一行,下一条命令必须换行。"disallow: "后面必须有一个空格。
    公司地址:汕头市龙湖区科技中路13号嘉泽中心大厦10楼B05
    联系电话:0754-88081031
    Email:2661419560@qq.com

    © 2005-2026 启成网络 版权所有。  粤ICP备15030689号-2

    启成网络
    启成网络
    启成网络