合并两个答案相近的页面,最容易丢的不是重复段落,而是各自独有的限定条件、例外情况和操作细节。保留独有信息的可行做法,是先把两页内容拆成“可合并的主干”和“不可替代的独有片段”,再决定哪些片段进入合并页、哪些需要改写成同一结构。样本少时人工比对通常够用,页面一多就必须换成可复核的字段清单,否则遗漏会集中在长尾细节上。
处理两三个页面时,编辑凭记忆就能发现哪句是独有的。但同类页面增加到几十个,独有信息往往藏在三种位置:一是条件句,比如“仅当某类内容为空时才适用”;二是范围句,比如某个做法只覆盖部分子类;三是操作顺序,比如先做哪一步会影响后续判断。这三种内容在肉眼比对时最容易被当成重复删掉,因为它们和主干答案长得很像,只是多了限定词。
一个假设例子:两个页面都回答“某类页面怎样设置标题”,A页写“标题应包含核心对象”,B页写“标题应包含核心对象,若对象本身有多个别名,只保留搜索意图最接近的那个”。如果只保留A页的句子,B页的别名取舍规则就消失了。这条规则不是重复,而是对主干答案的边界补充。规模小时这类句子只有一两条,规模大时会反复出现,最终表现为合并后的页面在特定子类上答非所问。
看到合并后表现不如预期,通常有两种解释。第一种是两页确实高度重复,独有信息本来就少,合并后信息量没有实质损失,问题出在别处。第二种是独有信息存在,但因为两页用了不同的表述结构,比对时没有对齐,导致它被误判为重复。
区分这两种解释,可以看合并前的原始记录。如果两页在条件、范围、操作顺序三个维度上完全一致,只有措辞不同,那更接近第一种。如果两页在这些维度上存在一方有、另一方无的差异,哪怕差异只是一句话,也更接近第二种。第二种情况下,合并动作本身没有错,错在比对方法只看了句子相似度,没有看信息维度是否齐全。
实际操作中,可以把每个页面的内容拆成固定字段再对照,而不是整段读。字段至少包括:适用对象、前提条件、例外情况、操作步骤、判断依据。把两页分别填入这组字段,独有信息会直接暴露在某一格为空的位置。
具体动作:先为两个页面各建一份字段表,逐格填写,填不出的格留空;然后逐格比较,只把两页同一格都有内容的视为候选重复,任何一格只有单侧有内容的,先标记为待保留。这个动作的结果会直接决定下一步——标记为待保留的片段,要么原样进入合并页,要么改写成与主干一致的句式后进入;只有两侧同格都有且含义一致的内容,才进入删除候选。这样做的价值在于,遗漏不再依赖记忆,而是依赖空格是否被填上。
需要说明适用条件:字段法适合答案结构相对稳定的页面,比如同类操作说明或同类概念解释。如果两个页面本身结构差异很大,一个是步骤式、一个是问答式,字段表需要先统一粒度,否则空格会大量出现,反而增加判断成本。这种情况下,先统一结构再比对,比直接合并更省事。
合并完成后,不要只看新页面是否通顺。更可靠的验证是反向检查:拿合并前的两份字段表,逐条确认每个待保留片段在新页面里有对应位置。如果某个片段被改写了,确认改写后仍保留原来的限定条件,而不是把条件句压缩成结论句。
另一个动作是观察合并后一段时间内的查询词变化。如果原先由被合并页面承接的、带有特定限定词的查询开始落到新页面但答非所问,说明独有信息可能在合并中丢失。这里要谨慎:查询词变化也可能来自搜索需求本身的波动、季节因素或数据采集口径差异,不能只凭一次前后对比就断定是合并导致的。更稳妥的做法是同时看合并前后的查询词分布是否出现结构性偏移,而不是只看总量升降。
字段法在样本增多后会遇到两个边界。第一,字段本身需要随页面类型调整,把操作说明的字段套到概念解释页上,会制造大量无意义空格。第二,当两个页面的独有信息都很多、且互相冲突时,合并可能不是正确选择,保留两个页面并明确各自适用条件反而更清晰。
判断是否该继续合并,可以看冲突字段的数量:如果只有个别字段冲突,合并后加一句条件说明即可;如果多数字段都冲突,说明两个页面回答的其实不是同一个问题,强行合并会把边界条件堆在一起,读者难以判断该用哪条。这种情况下,先确认两页的真实意图是否一致,再决定合并还是拆分,比直接执行合并更稳。