通过网站日志来寻找百度蜘蛛爬行规律
|
源代码网整理以下 对于各位站长来说,百度的收录是关心的重中之重,因为网站大部分流量都来自百度。 源代码网整理以下 因此,了解百度蜘蛛的爬行规律从而更好的改善收录情况也是必须要掌握的。 源代码网整理以下 很多网站目前使用的都是虚拟空间,都能够提供日志。从虚拟主机后台登录,点击下载访问日志。 源代码网整理以下 日志是指在网站根目录下的logfiles或W3SVC文件夹里面日期.txt文本文件 源代码网整理以下 更多的是类似我的网站建站学习网www.3915.net的日志格式,如下: 源代码网整理以下 开始几行: 源代码网整理以下 #Software: Microsoft Log Parser 源代码网整理以下 #Version: 1.0 源代码网整理以下 #Date: 2008-09-30 23:57:04 源代码网整理以下 #Fields: LogFilename RecordNumber ComputerName SiteID DateTime ClientIpAddress ServerIpAddress ServerPort Method ProtocolVersion ProtocolStatus SubStatus TimeTaken BytesSent BytesReceived Win32Status UriStem UriQuery UserName 源代码网整理以下 说明用的软件,版本,创建日期,字段说明 源代码网整理以下 举例说明: 源代码网整理以下 d:iislogW3SVC a080930.ibl 818972 COMPUTER88221 837 2008-09-30 12:52:51 202.108.7.205 58.241.151.91 80 GET HTTP/1.1 200 0 437 35074 267 0 /index.php - - 源代码网整理以下 分别表示: 源代码网整理以下 日志文件名:d:iislogW3SVC a080930.ibl 源代码网整理以下 记录数:818972 源代码网整理以下 计算机名称:COMPUTER88221 源代码网整理以下 站点ID:837 源代码网整理以下 访问日期:2008-09-30 12:52:51 源代码网整理以下 客户端IP:202.108.7.205 (客户端IP很重要,有的IP是搜索引擎爬虫的IP) 源代码网整理以下 服务器IP:58.241.151.91 源代码网整理以下 服务端口:80 源代码网整理以下 模式:GET 源代码网整理以下 HTTP协议版本:HTTP/1.1 源代码网整理以下 协议返回状态:200 (这个很重要,200是成功的应答码) 源代码网整理以下 记录的内容大小:35074 267 源代码网整理以下 访问页面: /index.php (这点是站长分析和以后努力的方向) 源代码网整理以下 都是这种格式的日志如何去分析了,一个一个看的头都大了。 源代码网整理以下 现在网上很多网站日志分析工具,其实你只要打开日志“CRTL+F”查找几个你最关心的IP就OK了。 源代码网整理以下 各类蜘蛛IP收集,不一定完全准确。 源代码网整理以下 序号 IP 注释 源代码网整理以下 1 202.106.186.* 163蜘蛛 源代码网整理以下 2 202.108.36.* 163蜘蛛 源代码网整理以下 3 202.108.44.* 163蜘蛛 源代码网整理以下 4 202.108.45.* 163蜘蛛 源代码网整理以下 5 202.108.5.* 163蜘蛛 源代码网整理以下 6 202.108.9.* 163蜘蛛 源代码网整理以下 7 220.181.12.* 163蜘蛛 源代码网整理以下 8 220.181.13.* 163蜘蛛 源代码网整理以下 9 220.181.14.* 163蜘蛛 源代码网整理以下 10 220.181.15.* 163蜘蛛 源代码网整理以下 11 220.181.28.* 163蜘蛛 源代码网整理以下 12 220.181.31.* 163蜘蛛 源代码网整理以下 13 222.185.245.* 163蜘蛛 源代码网整理以下 14 202.165.100.* 3721蜘蛛 源代码网整理以下 15 220.181.19.* 百度蜘蛛 源代码网整理以下 16 159.226.50.* 百度蜘蛛 源代码网整理以下 17 202.108.11.* 百度蜘蛛 源代码网整理以下 18 202.108.22.* 百度蜘蛛 源代码网整理以下 19 202.108.23.* 百度蜘蛛 源代码网整理以下 20 202.108.249.* 百度蜘蛛 源代码网整理以下 21 202.108.250.* 百度蜘蛛 源代码网整理以下 22 61.135.145.* 百度蜘蛛 源代码网整理以下 23 61.135.146.* 百度蜘蛛 源代码网整理以下 24 64.124.85.* become.com 源代码网整理以下 25 61.151.243.* china蜘蛛 源代码网整理以下 26 202.165.96.* gais.cs.ccu.edu.tw 源代码网整理以下 27 216.239.33.* google蜘蛛 源代码网整理以下 28 216.239.35.* google蜘蛛 源代码网整理以下 29 216.239.37.* google蜘蛛 源代码网整理以下 30 216.239.39.* google蜘蛛 源代码网整理以下 31 216.239.51.* google蜘蛛 源代码网整理以下 32 216.239.53.* google蜘蛛 源代码网整理以下 33 216.239.55.* google蜘蛛 源代码网整理以下 34 216.239.57.* google蜘蛛 源代码网整理以下 35 216.239.59.* google蜘蛛 源代码网整理以下 36 64.233.161.* google蜘蛛 源代码网整理以下 37 64.233.189.* google蜘蛛 源代码网整理以下 38 66.102.11.* google蜘蛛 源代码网整理以下 39 66.102.7.* google蜘蛛 源代码网整理以下 40 66.102.9.* google蜘蛛 源代码网整理以下 41 66.249.64.* google蜘蛛 源代码网整理以下 42 66.249.65.* google蜘蛛 源代码网整理以下 43 66.249.66.* google蜘蛛 源代码网整理以下 44 66.249.71.* google蜘蛛 源代码网整理以下 45 66.249.72.* google蜘蛛 源代码网整理以下 46 72.14.207.* google蜘蛛 源代码网整理以下 47 61.135.152.* iask蜘蛛 源代码网整理以下 48 65.54.188.* msn蜘蛛 源代码网整理以下 49 65.54.225.* msn蜘蛛 源代码网整理以下 50 65.54.226.* msn蜘蛛 源代码网整理以下 51 65.54.228.* msn蜘蛛 源代码网整理以下 52 65.54.229.* msn蜘蛛 源代码网整理以下 53 207.46.98.* msn蜘蛛 源代码网整理以下 54 207.68.157.* msn蜘蛛 源代码网整理以下 55 194.224.199.* noxtrumbot 源代码网整理以下 56 220.181.8.* Outfox 源代码网整理以下 57 221.239.209.* Outfox 源代码网整理以下 58 217.212.224.* psbot 源代码网整理以下 59 219.133.40.* QQ蜘蛛 源代码网整理以下 60 202.96.170.* QQ蜘蛛 源代码网整理以下 61 202.104.129.* QQ蜘蛛 源代码网整理以下 62 61.135.157.* QQ蜘蛛 源代码网整理以下 63 219.142.118.* sina蜘蛛 源代码网整理以下 64 219.142.78.* sina蜘蛛 源代码网整理以下 65 61.135.132.* sohu蜘蛛 源代码网整理以下 66 220.181.26.* sohu蜘蛛 源代码网整理以下 220.181.19.* 源代码网整理以下 67 61.135.158.* tom蜘蛛 源代码网整理以下 68 66.196.90.* yahoo蜘蛛 源代码网整理以下 69 66.196.91.* yahoo蜘蛛 源代码网整理以下 70 68.142.249.* yahoo蜘蛛 源代码网整理以下 71 68.142.250.* yahoo蜘蛛 源代码网整理以下 72 68.142.251.* yahoo蜘蛛 源代码网整理以下 73 202.165.102.* yahoo中国蜘蛛 源代码网整理以下 74 202.160.178.* yahoo中国蜘蛛 源代码网整理以下 75 202.160.179.* yahoo中国蜘蛛 源代码网整理以下 76 202.160.180.* yahoo中国蜘蛛 源代码网整理以下 77 202.160.181.* yahoo中国蜘蛛 源代码网整理以下 78 202.160.183.* yahoo中国蜘蛛 源代码网整理以下 79 72.30.101.* yahoo蜘蛛 源代码网整理以下 80 72.30.102.* yahoo蜘蛛 源代码网整理以下 81 72.30.103.* yahoo蜘蛛 源代码网整理以下 82 72.30.104.* yahoo蜘蛛 源代码网整理以下 83 72.30.107.* yahoo蜘蛛 源代码网整理以下 84 72.30.110.* yahoo蜘蛛 源代码网整理以下 85 72.30.111.* yahoo蜘蛛 源代码网整理以下 86 72.30.128.* yahoo蜘蛛 源代码网整理以下 87 72.30.129.* yahoo蜘蛛 源代码网整理以下 88 72.30.131.* yahoo蜘蛛 源代码网整理以下 89 72.30.133.* yahoo蜘蛛 源代码网整理以下 90 72.30.134.* yahoo蜘蛛 源代码网整理以下 91 72.30.135.* yahoo蜘蛛 源代码网整理以下 92 72.30.216.* yahoo蜘蛛 源代码网整理以下 93 72.30.226.* yahoo蜘蛛 源代码网整理以下 94 72.30.252.* yahoo蜘蛛 源代码网整理以下 95 72.30.97.* yahoo蜘蛛 源代码网整理以下 96 72.30.98.* yahoo蜘蛛 源代码网整理以下 97 72.30.99.* yahoo蜘蛛 源代码网整理以下 98 74.6.74.* yahoo蜘蛛 源代码网整理以下 99 202.108.4.* 中搜蜘蛛 源代码网整理以下 100 202.108.4.* 中搜蜘蛛 源代码网整理以下 101 202.108.33.* 中搜蜘蛛 源代码网整理以下 102 202.96.51.* 中搜蜘蛛 源代码网整理以下 103 219.142.53.* 中搜蜘蛛 源代码网整理以下 对202.108的IP段一定要注意,这个网段的IP地址是位于北京网通电报大楼,属于全国互联网核心骨干机房,现在 源代码网整理以下 此IP段已经绝迹了。好多蜘蛛服务器都在这里面,尤其是百度的。 源代码网整理以下 相信通过这此分析,你就应该对你的网站上蜘蛛活动有所了解,进行下一步的计划了吧。 源代码网整理以下 文章来自:http://www.3915.net 本人QQ:290975802,愿结交有志的站长. 源代码网供稿. |
