结论先行:只有当旧型号页面仍能承接搜索需求、且新型号页面已经具备独立可索引内容时,才值得在 robot txt 层面放行两者并存;否则应优先让旧页面退出索引,而不是靠抓取规则硬撑。这个结论有一个容易失效的反例——如果旧页面承担着大量外链和站内入口,直接屏蔽会连带损失这些信号,衔接策略就要改成保留入口、改写内容。
型号更替后,新旧内容的衔接本质上是三件事分开处理:抓取、索引、排名。robot txt 只影响抓取,不能决定页面是否被索引,更不能决定它排第几。所以第一步不是改文件,而是判断旧页面还有没有独立价值。
判断依据可以来自站内搜索词、客服问询记录、旧页面自身的外链分布。这些证据指向不同结论时,以“旧页面是否还能独立满足一个查询意图”为准。
robot txt 的作用是告诉爬虫哪些路径可以抓取。它不传递“这个页面已废弃”的信号,也不负责把权重转移到新页面。常见的错误做法是:新型号上线后,直接在 robot txt 里屏蔽旧型号目录,以为这样就能完成更替。结果是旧页面逐渐从索引消失,但它积累的外链和入口价值也一起断掉,新型号页面并不会自动继承。
如果确实要让旧页面退出,更合适的动作是:
这里有一个实际动作及其后果:如果你先屏蔽旧目录、再想改回 301,爬虫需要重新发现这些 URL 才能读到跳转指令,衔接周期会被拉长。所以顺序应该是先处理页面级信号,最后才动 robot txt。
假设旧型号页面没有任何外链,站内也没有入口,只是靠自身内容获得过一些长尾流量。这种情况下,“保留入口、改写内容”的策略不成立,因为没有入口可保。此时直接 301 到新型号页面,或者让旧页面自然退出索引,都是合理选择。区分点在于:旧页面的价值是来自外部信号,还是仅来自它自身的内容匹配。前者需要衔接,后者不需要。
另一个失效条件是:新型号页面尚未完成内容建设,只是占位。此时无论怎么处理旧页面,用户和爬虫都得不到有效落点。正确顺序是先让新型号页面具备可索引的实质内容,再决定旧页面的去向。
按以下顺序执行,每一步的结果决定下一步:
把 robot txt 放在最后一步,是因为它影响的是爬虫能读到什么,而不是页面本身表达什么。先让页面把话说清楚,再决定要不要让爬虫少走某些路。