◆◆0

石頭誋：神奇的robots见证网站的兴衰

来源：移动小鬼 2019-02-28 19:27:30 SEO优化 583 0

很早就答应给啊彬写一篇文章的，感谢他对我的一个帮助，但是一直到现在也没有写出来，前几天看到卓少问了一个问题关于robots的问题，给大家整理了一下robots的一些情况。robots.txt文件放在网站根目录下，是搜索引擎中访问网站的时候要查看的第一个文件。当一个搜索蜘蛛访问一个站点时，它会首先检查该站点根目录下是否存在robots.txt，如果存在，搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在，所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。每个网站都应该有一个robots，它告诉搜索引擎我的网站里有哪些东西是不允许抓取的，有哪些页面是欢迎爬行与抓取。

robots的几种作用：

1.屏蔽所有的搜索引擎抓取信息，如果你的网站只是你的私密性的网站，不想太多的人知道的话，可以利用robots屏蔽掉所有的搜索引擎，例如你写的私人博客。你就可以把搜索引擎全都屏蔽掉

User-agent:*

Disallow: /

2.如果你只想某一个搜索引擎抓取你的信息，这个时候就可以用robots进行设置，例如：我只想我的网站被百度这个收录，而不想被别的搜索引擎收录。就可以利用robots进行设置

User-agent: Baiduspider

Allow:

User-agent: *

Disallow: /

3.可以利用各种通配符对网站进行相对应的调配，例如我不想网站抓取我的所有图片，这个时候就可以运用$来进行设置。一般我们常见的图片的格式是BMP、JPG、GIF、JPEG等格式。这个时候设置就是：

User-agent: *

Disallow: /.bmp$

Disallow: /.jpg$

Disallow: /.gif$

Disallow: /.jpeg$

4.还可以利用*来屏蔽掉相关的URL，有些网站不允许搜索引擎抓取动态地址的时候可以利用这个*通配符来进行匹配设置。一般情况下动态URL的有一个特点就是有“？”这个时候我们就可以利用这个特性来进行匹配的屏蔽：

User-agent: *

Disallow: /*?*

5.如果网站改版了，整个文件夹都没有了的时候，这个情况下就要考虑屏蔽掉整个文件夹。我们可以运用robots来对这整个的文件夹进行屏蔽，例如网站里的ab文件夹因改版全都给删掉了，这个时候就可以这样子设置：

User-agent: *

Disallow: /ab/

6.如果网站里有一个文件夹不想被收录，但是在这个文件夹里面有一个信息是允许被收录。那可以运用robots的allow进行设置。例如我网站里ab文件夹不允许搜索引擎抓取，但是在ab文件夹里面又有一个信息cd是允许被抓取的，这个时候就可以运用robots进行设置：

User-agent: *

Disallow: /ab/

Allow:/ab/cd

7.可以在robots里定义出网站地图的位置，有利于网站的收录。

sitemap:<网站地图的位置>

8.有的时候你会发现我的网站里设置了robots但是还发现其收录了这个URL地址，这个的原因是因为这个搜索引擎的蜘蛛是通过URL爬行到网页的一般 google抓取这样子的URL的时候是不带title与描述的，但是百度抓取这个URL会带上title与描述，所以有很多有人会说我设置了 robots但是没有效果。实际情况是抓取了这个链接而没有收录这个页面内容。

网站的首页权重是最高的，权重是靠链接传递的，我们设置robots是为了更好的把权重传递给那些需要有很高权重的页面，而有一些页面则是不需要搜索引擎抓取和爬行的。

本文版权归石頭誋所以，转载请保留http://www.mobkid.com/链接

声明：站长码字很辛苦啊,转载时请保留本声明及附带文章链接：https://blog.tag.gg/showinfo-36-8358-0.html

亲爱的：若该文章解决了您的问题,可否收藏+评论+分享呢？

相关文章

文章评论 本文章有个评论

文章评论本文章有个评论