先不要改标题,也不要重新导入。把“错位”当成一个可验证的对应关系问题:先固定一份基准表,再用文件名、正文首段和唯一标识三列做交叉核对,能对上的先放行,对不上的单独列出。这样做的结果是,你接下来处理的不是“全部乱套”,而是少数几条真正无法对应的记录,修改范围会小很多。
导入内容后标题与文件错位,常见原因不是标题本身错,而是核对时用了两个不同的基准。有人按文件名判断,有人按正文首段判断,还有人按导入顺序判断,三种看法一旦混用,就会得出互相矛盾的结论。
实际操作时,先选定一列作为基准。如果文件是从固定目录批量导入的,文件名通常最稳定,适合作为基准列;如果文件名被改过或本身无意义,就用正文首段里出现次数最少的那个专有名词作为基准。基准一旦选定,本次核对过程中不要更换。这一步的结果是,后续每一条记录都只有一个“应该对应谁”的答案,分歧从观点之争变成数据比对。
把待核对的记录整理成三列:文件名、导入后的标题、正文中一个唯一标识。唯一标识可以是一个编号、一个不重复的短语,或正文首段里只出现一次的名称。三列中至少两列一致,才判定对应关系成立。
假设有二十条记录,其中十五条三列一致,三条只有标题不一致,两条三列都不一致。这个假设说明的是比较方法:先处理三条标题映射问题,再单独查两条来源不明记录。结果是你不会因为两条异常而重做全部二十条。
多个角色对同一事实有不同理解时,争论往往停留在“我觉得这条对不上”。把它转成核对项目,需要写清三件事:以哪一列为基准、判定一致的标准是什么、不一致时回到哪个源文件。写清之后,每个人都可以独立跑一遍同样的比对,结论应该相同。
如果两个人跑出的结果不同,先检查是不是用了不同的基准列,而不是先怀疑数据。基准列不同是分歧最常见的来源,也是最容易排除的一种。排除之后仍然对不上的记录,才是真正需要人工判断的部分。
修改标题字段或重做映射后,不要只看被改的那几条。用同一套三列方法再跑一遍全部记录,重点看之前一致的那些是否仍然一致。一次改动前后比较要考虑同一批内容是否有新增或删除,也要考虑导入时间不同带来的顺序差异,不能只凭“这次对上了”就断定处理正确。
如果发现改完之后错位数量没有下降,先确认是不是把基准列也一起改了。基准列一变,之前成立的对应关系会全部失效,看起来像问题变多,实际是核对口径变了。遇到这种情况,回到上一步重新固定基准,再比对一次。
当错位比例很高,且文件名和正文标识都无法稳定区分记录时,逐条核对的成本会超过重新导入。此时更合理的动作是回到导出环节,确认导出时是否保留了唯一标识字段。如果源数据本身就没有可区分的标识,任何核对方法都只能靠人工判断,这时应先补上标识,再重新导入,而不是在结果里反复修补。
判断标准很简单:如果同一批记录里,你能稳定说清“这条应该对应哪一条”的比例偏低,就不要继续在导入结果上花时间。先解决标识问题,再回来核对,后面的每一步都会更省力。