或者

Robots协议-robots.txt写法

作者:Promise.(承诺) 浏览:123 发布时间:2017-08-27
分享 评论 0

    User-agent: * 这里的*代表的所有的搜索引擎种类,*是一个通配符


    Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录


    Disallow:/A 是屏蔽A目录下的所有文件,包括文件和子目录,还屏蔽 /A*.*的文件


    Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录


    Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录


    Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以“。htm”为后缀的URL(包含子目录)。


    Disallow: /*?* 禁止访问网站中所有包含问号 (?) 的网址(动态页面)


    Disallow: /.jpg$ 禁止抓取网页所有的。jpg格式的图片


    Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。


    Allow: /cgi-bin/ 这里定义是允许爬寻cgi-bin目录下面的目录


    Allow: /tmp 这里定义是允许爬寻tmp的整个目录


    Allow: /*.htm$ 仅允许访问以“。htm”为后缀的URL。


    Allow: /*.gif$ 允许抓取网页和gif格式图片


    Sitemap: 网站地图 告诉爬虫这个页面是网站地图。如,Sitemap: http://www.***.com/sitemap.xml(此处请填写XML地图的绝对路径,即完整URL,如果按习惯填写Sitemap: /sitemap.xml,提交后会提示:检测到无效的 Sitemap 网址;语法错误。XML地图必须在网站根目录下才有效。)


    注:我们常用的搜索引擎类型有:(User-agent区分大小写)


    google蜘蛛:Googlebot


    百度蜘蛛:Baiduspider


    360蜘蛛:360Spider


    sogou蜘蛛:Sogou Web Spider


    yahoo蜘蛛:Yahoo!slurp


    alexa蜘蛛:ia_archiver


    bing蜘蛛:MSNbot


    altavista蜘蛛:scooter


    lycos蜘蛛:lycos_spider_(t-rex)


    alltheweb蜘蛛:fast-webcrawler


    inktomi蜘蛛:slurp


    Soso蜘蛛:Sosospider


    Google Adsense蜘蛛:Mediapartners-Google


    有道蜘蛛:YoudaoBot


    泽许蜘蛛: Zexuwhte