要正确设置网站robots.txt文件啊
刚心血来潮,在谷歌搜索框里输入site:www.imwen.com,然后翻到最后面看,却不想此刻我惊呆了,因为整页的搜索结果都是You are not login, Exiting...,这是搜索引擎没有登录网站后台(废话,搜索引擎都登录了网站后台,那还了得)被拒绝服务的信息。
我往前翻,郁闷了,好几页了,还是这个结果,一直翻了五页,才发现收录的正常网页。不过我立马就明白是我博客的robots.txt文件没有设置正确,让搜索引擎试图爬行了需要登录后台才能浏览的页面,这当然会导致访问出错,就如普通访客没有登录进不了后台一样。
这样的收录结果,对于网站来说,是不利的,别看现在谷歌收录了,对于我这个新站来说,还在沙盒里呢,记得卢同志有说过这个。我得重新调整一下robots.txt文件,才能让搜索引擎满意,一定程度上来说,间接对用户友好性会好点,因为搜索引擎索引越精确,搜索结果提供的内容质量也会比较好吧。总之尽量避免下面图中所示的这个情况出现了。

至于robots.txt文件,百度一下,百度百科的答案就可以了。主要就是要建立一个robots.txt文件,叫做搜索引擎蜘蛛爬行许可文件吧。放在网站根目录下,robts.txt文件里基本语法是(括号内为注释内容):
User-agent : * (本句代码表示对哪些搜索引擎起作用,理论上*表示任何搜索引擎)
Disallow : / ADMIN / (Disallow表示不允许访问索引,例如本句的ADMIN文件夹)
Disallow : / DATA / (不爬行索引数据库文件夹及其里面的任何文件)
Disallow : / CSS / (不爬行索引样式文件夹及其里面的任何文件)
Disallow : / FUJIAN / IMAGE / (不爬行附件下的图片文件夹及其里面的任何文件)
总之,按照搜索引擎的游戏规则,作为网站一定要置放robots.txt文件,如果不清楚该怎么弄robots.txt里面的句法语法,那就什么都不填,就一个空的robots.txt,对搜索引擎而言,也是起作用的。
上面介绍的内容,我也是略有了解,有什么不对的地方,还请来此关照我的高人们尽情指点!


