robot txt:产品型号更替后新旧内容如何衔接

📍 WDQWDWQD987AAAAA:216.73.216.67
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /e58228d8fd64.html
📄

robot txt:产品型号更替后新旧内容如何衔接

结论先行:只有当旧型号页面仍能承接搜索需求、且新型号页面已经具备独立可索引内容时,才值得在 robot txt 层面放行两者并存;否则应优先让旧页面退出索引,而不是靠抓取规则硬撑。这个结论有一个容易失效的反例——如果旧页面承担着大量外链和站内入口,直接屏蔽会连带损失这些信号,衔接策略就要改成保留入口、改写内容。

先判断旧型号页面该保留还是该退出

型号更替后,新旧内容的衔接本质上是三件事分开处理:抓取、索引、排名。robot txt 只影响抓取,不能决定页面是否被索引,更不能决定它排第几。所以第一步不是改文件,而是判断旧页面还有没有独立价值。

判断依据可以来自站内搜索词、客服问询记录、旧页面自身的外链分布。这些证据指向不同结论时,以“旧页面是否还能独立满足一个查询意图”为准。

robot txt 能做什么、不能做什么

robot txt 的作用是告诉爬虫哪些路径可以抓取。它不传递“这个页面已废弃”的信号,也不负责把权重转移到新页面。常见的错误做法是:新型号上线后,直接在 robot txt 里屏蔽旧型号目录,以为这样就能完成更替。结果是旧页面逐渐从索引消失,但它积累的外链和入口价值也一起断掉,新型号页面并不会自动继承。

如果确实要让旧页面退出,更合适的动作是:

  1. 把旧页面做 301 跳转到对应的新型号页面,而不是在 robot txt 里屏蔽。
  2. 只有当你希望旧页面保留可访问性、但不想让它出现在搜索结果中时,才考虑用页面级 noindex,而不是 robot txt 屏蔽——因为被 robot txt 屏蔽的页面,爬虫无法读到 noindex 标签。
  3. robot txt 只在一种情况下介入:旧型号目录下存在大量参数页、筛选页等低价值 URL,需要限制爬虫在这些路径上消耗抓取预算。

这里有一个实际动作及其后果:如果你先屏蔽旧目录、再想改回 301,爬虫需要重新发现这些 URL 才能读到跳转指令,衔接周期会被拉长。所以顺序应该是先处理页面级信号,最后才动 robot txt。

一个会让上述结论失效的反例

假设旧型号页面没有任何外链,站内也没有入口,只是靠自身内容获得过一些长尾流量。这种情况下,“保留入口、改写内容”的策略不成立,因为没有入口可保。此时直接 301 到新型号页面,或者让旧页面自然退出索引,都是合理选择。区分点在于:旧页面的价值是来自外部信号,还是仅来自它自身的内容匹配。前者需要衔接,后者不需要。

另一个失效条件是:新型号页面尚未完成内容建设,只是占位。此时无论怎么处理旧页面,用户和爬虫都得不到有效落点。正确顺序是先让新型号页面具备可索引的实质内容,再决定旧页面的去向。

下一步动作:用一份检查清单决定顺序

按以下顺序执行,每一步的结果决定下一步:

  1. 列出旧型号页面清单,标注每个页面的外链数、站内入口数、近期的查询词。
  2. 对每个旧页面判断:保留、改写、还是退出。保留和改写不需要动 robot txt;退出优先用 301。
  3. 确认新型号页面已经可以独立索引,标题、正文、结构化信息都指向新型号本身,而不是旧型号的复制。
  4. 只有在旧目录下存在大量无价值 URL 时,才在 robot txt 中限制这些路径的抓取。
  5. 改动后观察日志中的抓取分布和索引状态变化。注意:抓取量下降或某个统计归零,不能单独证明处理正确,也可能只是爬虫调度周期变化、站点整体抓取预算调整,或页面本身响应变慢。

把 robot txt 放在最后一步,是因为它影响的是爬虫能读到什么,而不是页面本身表达什么。先让页面把话说清楚,再决定要不要让爬虫少走某些路。

图1 图2

nginx