Baiduspider抓取过程中涉及的网络协议 _usp

文章插图
Baiduspider抓取过程中涉及的网络协议
刚才提到百度搜索引擎会设计复杂的抓取策略，其实搜索引擎与资源提供者之间存在相互依赖的关系，其中搜索引擎需要站长为其提供资源，否则搜索引擎就无法满足用户检索需求；而站长需要通过搜索引擎将自己的内容推广出去获取更多的受众。 spider抓取系统直接涉及互联网资源提供者的利益，为了使搜素引擎与站长能够达到双赢，在抓取过程中双方必须遵守一定的规范，以便于双方的数据处理及对接。这种过程中遵守的规范也就是日常中我们所说的一些网络协议。
以下简单列举：
? ? ? ? http协议：超文本传输协议，是互联网上应用最为广泛的一种网络协议，客户端和服务器端请求和应答的标准。客户端一般情况是指终端用户，服务器端即指网站。终端用户通过浏览器、蜘蛛等向服务器指定端口发送http请求。发送http请求会返回对应的httpheader信息，可以看到包括是否成功、服务器类型、网页最近更新时间等内容。
https协议：实际是加密版http ，一种更加安全的数据传输协议。
UA属性：UA即user-agent ，是http协议中的一个属性，代表了终端的身份，向服务器端表明我是谁来干嘛，进而服务器端可以根据不同的身份来做出不同的反馈结果。
robots协议：robots.txt是搜索引擎访问一个网站时要访问的第一个文件，用以来确定哪些是被允许抓取的哪些是被禁止抓取的。 robots.txt必须放在网站根目录下，且文件名要小写。详细的robots.txt写法可参考 http://www.robotstxt.org 。百度严格按照robots协议执行，另外，同样支持网页内容中添加的名为robots的meta标签， index、follow、nofollow等指令。
Baiduspider抓取频次原则及调整方法
Baiduspider根据上述网站设置的协议对站点页面进行抓取，但是不可能做到对所有站点一视同仁，会综合考虑站点实际情况确定一个抓取配额，每天定量抓取站点内容，即我们常说的抓取频次。那么百度搜索引擎是根据什么指标来确定对一个网站的抓取频次的呢，主要指标有四个：
? ? ? ? 1 ，网站更新频率：更新快多来，更新慢少来，直接影响Baiduspider的来访频率
? ? ? ? 2 ，网站更新质量：更新频率提高了，仅仅是吸引了Baiduspier的注意， Baiduspider对质量是有严格要求的，如果网站每天更新出的大量内容都被Baiduspider判定为低质页面，依然没有意义。
? ? ? ? 3 ，连通度：网站应该安全稳定、对Baiduspider保持畅通，经常给Baiduspider吃闭门羹可不是好事情
? ? ? ? 4 ，站点评价：百度搜索引擎对每个站点都会有一个评价，且这个评价会根据站点情况不断变化，是百度搜索引擎对站点的一个基础打分（绝非外界所说的百度权重），是百度内部一个非常机密的数据。站点评级从不独立使用，会配合其它因子和阈值一起共同影响对网站的抓取和排序。
【Baiduspider抓取过程中涉及的网络协议】 抓取频次间接决定着网站有多少页面有可能被建库收录，如此重要的数值如果不符合站长预期该如何调整呢？百度站长平台提供了抓取频次工具（http://zhanzhang.baidu.com/pressure/index），并已完成多次升级。该工具除了提供抓取统计数据外，还提供“频次调整”功能，站长根据实际情况向百度站长平台提出希望Baiduspider增加来访或减少来访的请求，工具会根据站长的意愿和实际情况进行调整。

Baiduspider抓取过程中涉及的网络协议

相关经验推荐

IT之家 12 月 6 日消息|Steam 上周销量排行榜：《翼星求生》登顶

大米里生白色虫子怎么办

清晰度切换方法央视影音直播怎么调清晰度

带20多个领导玩热血传奇?工作被安排,人生就此开挂逆袭

安化黑茶怎么形成的金花

拖雷吉亚|背叛光之国还有理了，这三个奥特曼为什么憎恨奥特之父！

本田雅阁发动机号在哪

寂然巅峰赛撞车北慕，2次三杀教对手做人，网友直言他不比北慕差

ie浏览器有哪些？ie浏览器有哪些版本

鑫耀东方与鑫享事诚分别适合哪些人购买？

猴王牌茶怎么样

埼玉|一拳超人：神明曾经统治过人类，大蛇不过是他们复活的祭品！

像鲶鱼一样的叫什么鱼

烯酰吗啉和霜脲氰能合用吗氰霜唑配烯酰吗啉效果

各时期强势的英雄都有哪些呢,后期最强的你肯定想不到

王者荣耀的王者时刻权限怎么开启（王者时刻权限开启方法）

广东教资面试时间2021年上半年 2023上半年广东教资面试对象是谁

方向|讲道理，“动画迷”和“动漫迷”是不一样的两种人

中华鲟是几级保护动物，野生的中华鲟是几级保护动物

国王排名|国王排名：冥府之王德斯哈，充满坏人元素，却是一位值得敬佩的王