惊雷算法针对的是链接作弊与点击作弊这类操纵排名的行为,它作用在“排名”环节,而不是抓取或索引环节。要区分抓取、索引和排名,最直接的办法是看页面处于哪一层:抓取是搜索引擎能否取到页面内容,索引是内容能否进入可被检索的库,排名是已索引页面在某个查询下出现的位置。惊雷算法不会阻止抓取,也不会把页面从索引里删掉,它影响的是页面在结果中的排序表现。
抓取关注的是可访问性。检查项是服务器是否返回正常状态码、robots.txt 是否放行、页面是否需要登录或依赖脚本才能渲染。结果说明的是“搜索引擎有没有拿到这份内容”。
索引关注的是内容能否被收录。检查项是页面是否被标记为 noindex、内容是否与已有页面高度重复、是否被规范标签指向了别的地址。结果说明的是“这份内容有没有资格参与检索”。
排名关注的是已索引页面在查询中的位置。检查项是同一查询下页面的名次变化、展现量与点击量的关系、外链与点击行为是否异常。结果说明的是“它在可检索的前提下排得好不好”。
惊雷算法属于第三层。它处理的是通过人为点击、互点、刷量等方式干预排序的行为。所以当你怀疑受惊雷算法影响时,抓取和索引通常是正常的,异常出现在排名和点击数据上。
方案一是按抓取索引问题处理:适合日志无爬虫记录、页面返回错误码、存在 noindex 或规范冲突的情况。判断结果是问题不在排名层,修好可访问性和收录设置即可。
方案二是按排名操纵问题处理:适合页面已正常抓取、已进入索引、但排名与点击数据出现异常模式的情况。此时应停止任何人为点击或互点操作,让排序回归内容与链接的自然信号。
两者的分界点很清楚:抓取和索引是“能不能被看到”,排名是“被看到时排第几”。惊雷算法只处理后者,且只针对操纵行为。如果你发现页面根本抓不到或没被收录,就不该把原因归到惊雷算法上。
假设某页面在日志中有正常抓取记录,站点查询也显示已索引,但某个查询词下的名次在一周内从靠前掉到很后,同时点击数据里出现大量来源集中、停留极短的访问。这个组合更符合排名操纵被处理的特征,而不是抓取或索引故障。反之,如果日志里根本没有该页面的抓取记录,那无论排名怎么变,首先要解决的是抓取。
下一步:挑一个你正在观察的页面,按上面的清单依次记录抓取、索引、排名、点击四项数据。哪一项先出现异常,就从那一层开始处理,不要跳过前两层直接怀疑惊雷算法。