处理死链时,正常结果是指目标页面按预期返回明确状态、访问者被导向有效内容或明确移除;异常结果则是状态码与页面内容矛盾、跳转链过长、返回软404、误拦正常抓取,或修复后仍然出现旧链接。区分的关键不是看工具报告里有没有红字,而是把“请求状态”“页面内容”“跳转终点”“抓取权限”四项放在一起核对。
开始处理前,先把待处理链接整理成清单,至少记录原始URL、发现来源、首次发现时间、当前返回状态、跳转终点和页面标题。发现来源可以是站内链接、外部链接、站点地图或访问日志,不同来源的优先级不同:站内导航和重要内容页的死链应优先处理,低价值的历史附件可以合并或直接移除。
判断基线要包含一个正常样本和一个异常样本。正常样本例如:请求一个已删除页面,服务器返回404或410,页面明确提示内容不存在,且没有自动跳转到首页。异常样本例如:请求同样已删除的页面,服务器返回200,但页面内容是“抱歉,未找到”,这就是软404,属于典型异常结果。
处理死链通常有四种动作,选择哪一种取决于原链接是否还有价值、是否有等价替代页、是否被外部引用。
200且内容与原主题一致。404更明确,但不要用它掩盖本应恢复的页面。这里最关键的一步是核对跳转终点。假设一个旧产品页已下线,你把它301到新产品页,但新产品页又跳转到分类页,分类页再跳转到首页。对访问者来说最终能打开,但对判断而言这是异常结果,因为跳转链过长、终点与原始主题偏离,容易让抓取和归因都变得模糊。正常做法是旧链接直接301到最终等价页面,一次跳转完成。
处理完成后不能只看“能打开”。建议逐条做以下核对:
301、404、410还是200。返回200但内容是错误提示,按软404处理。robots.txt限制抓取。robots.txt 的抓取限制不等于可靠的索引移除,它只约束抓取行为,不能替代状态码和页面处理。另外要区分“可能原因”和“已经定位的原因”。例如某个旧链接返回404,可能原因是页面被删除、URL被改写、服务器配置错误或大小写不一致;只有逐项核对服务器规则、文件路径和链接写法后,才能说已经定位到具体原因。不要看到404就断言页面一定被删了。
死链处理不是一次性动作。站点改版、内容下线、URL规则调整后,旧链接会再次出现。维护时可以定期抽查高价值链接、站内导航链接和外部引用较多的链接,观察它们是否仍然返回预期状态。站点地图不保证收录,提交站点地图也不等于死链已经被正确处理,它只是发现渠道之一。
如果使用HTTPS,也不要把它当成死链修复的充分条件。HTTPS 不保证安全无漏洞或排名,它只解决传输层加密问题,与链接是否有效是两件事。不同搜索引擎对状态码、跳转和移除请求的支持情况须分别核查,不能用一个平台的结果直接推断另一个平台。
下一步:从清单中挑出访问量最高或外部引用最多的10条死链,逐条记录原始URL、当前状态码、跳转终点和落地页主题,先处理其中状态码与内容明显矛盾的那几条。