静态站点页面robots.txt写法-百问二

静态站点页面robots.txt写法

Robots.txt是一种存放于网站根目录下的ASCII编码的文本文件，它通常告诉网络搜索引擎的漫游器（又称网络蜘蛛），此网站中的哪些内容是不能被搜索引擎的漫游器获取的，哪些是可以被（漫游器）获取的。一个典型的文件内容如下： User-agent: Disallow: /cgi-bin/ Disallow: /tmp/ Disallow: /private/ 因为一些系统中的URL是大小写敏感的，所以Robots.txt的文件名应统一为小写，即robots.txt。robots.txt应放置于网站的根目录下。如果想单独定义搜索引擎的漫游器访问子目录时的行为，那么可以将自定的设慎此置合并到根目录下的robots.txt，或者使用robots元数据。 Robots.txt协议并不是一个规范，而只是约定俗成的，所以并不能保证网站的隐私。注意Robots.txt是用字符串比较来确定是否获取URL，所以目录末尾有和没有斜杠“/”这两种表示是不同的URL，也不能用"Disallow: .gif"这样的通配符。其他的影响搜索引擎的行为的方法包括使用robots元数据：这个协议也不是一个规范，而只是约定俗成的，通常搜索引擎会识别这个元数据，不索引这个页面，以及这个页面的链出页面。 robots.txt是一个纯文本文件，在这个文件中网站管没枝理者可以声明该网站中不想被robots访问的部分，或者指定搜索引擎只收录指定的内容。当一个搜索机器人（有的叫搜索蜘蛛）访问一个站点时，它会首先检查该站点根目录下是否存在robots.txt，如果存在，搜索机器人就会按照该文件中的内容来确定访问的范围；如果该文件不存在，那么搜索机器人就沿着链接抓取。另外，robots.txt必须放置在一个站点的根目录下，而且文件名必须全部小写。 robots.txt写作语法首先，我们来看一个robots.txt范例：http://www.csswebs.org/robots.txt 访问以上具体地址，我们可以看到robots.txt的具体内容如下： # Robots.txt file from http://www.csswebs.org # All robots will spider the domain User-agent: * Disallow: 以上文本表达的意思是允许所有的搜索机器人访问www.csswebs.org站点下的所有文件。具体语法分析：其中#后面文字为说明信息；User-agent:后面为搜索机器人的名称，后面如果是*，则泛指所有的搜索机器人；Disallow:后面为不允许访问的文件目录。下面，我将列举一些robots.txt的具体用法：允许所有的robot访问 User-agent: * Disallow: 或者也可以建一个空文件 “/robots.txt” file 禁止所有搜索引擎访问网站的任何部分 User-agent: * Disallow: / 禁止所有搜索引擎访问网站的几个部分（枯孝敏下例中的01、02、03目录） User-agent: * Disallow: /01/ Disallow: /02/ Disallow: /03/ 禁止某个搜索引擎的访问（下例中的BadBot） User-agent: BadBot Disallow: / 只允许某个搜索引擎的访问（下例中的Crawler） User-agent: Crawler Disallow: User-agent: * Disallow: / 另外，我觉得有必要进行拓展说明，对robots meta进行一些介绍： Robots META标签则主要是针对一个个具体的页面。和其他的META标签（如使用的语言、页面的描述、关键词等）一样，Robots META标签也是放在页面的＜head＞＜/head＞中，专门用来告诉搜索引擎ROBOTS如何抓取该页的内容。 Robots META标签的写法： Robots META标签中没有大小写之分，name=”Robots”表示所有的搜索引擎，可以针对某个具体搜索引擎写为name=”BaiduSpider”。 content部分有四个指令选项：index、noindex、follow、nofollow，指令间以“,”分隔。 INDEX 指令告诉搜索机器人抓取该页面； FOLLOW 指令表示搜索机器人可以沿着该页面上的链接继续抓取下去； Robots Meta标签的缺省值是INDEX和FOLLOW，只有inktomi除外，对于它，缺省值是INDEX,NOFOLLOW。这样，一共有四种组合：＜META NAME=”ROBOTS” CONTENT=”INDEX,FOLLOW”＞＜META NAME=”ROBOTS” CONTENT=”NOINDEX,FOLLOW”＞＜META NAME=”ROBOTS” CONTENT=”INDEX,NOFOLLOW”＞＜META NAME=”ROBOTS” CONTENT=”NOINDEX,NOFOLLOW”＞其中＜META NAME=”ROBOTS” CONTENT=”INDEX,FOLLOW”＞可以写成＜META NAME=”ROBOTS” CONTENT=”ALL”＞；＜META NAME=”ROBOTS” CONTENT=”NOINDEX,NOFOLLOW”＞可以写成＜META NAME=”ROBOTS” CONTENT=”NONE”＞目前看来，绝大多数的搜索引擎机器人都遵守robots.txt的规则，而对于Robots META标签，目前支持的并不多，但是正在逐渐增加，如著名搜索引擎GOOGLE就完全支持，而且GOOGLE还增加了一个指令“archive”，可以限制GOOGLE是否保留网页快照。例如：＜META NAME=”googlebot” CONTENT=”index,follow,noarchive”＞表示抓取该站点中页面并沿着页面中链接抓取，但是不在GOOLGE上保留该页面的网页快照。

相关文章

声声慢小说txt全集免费下载

武动乾坤txt

《《东方不败之暖阳》月下蝶影》最新txt全集下载

1 求《NBA之狩猎者》TXT全本！ 其他的关于NBA的书也可以、谢谢。速求！

2 《飘渺之旅》txt全集下载

3 《马夫皇朝》txt全集下载

4 《偷来的爱》txt全集下载

5 求倾世狂妃废材四小姐txt下载

1 求《NBA之狩猎者》TXT全本！其他的关于NBA的书也可以、谢谢。速求！