核心做法不是修复打不开的旧文件,而是趁还能读取时把字段名、单位、采集口径和空值规则转成纯文本字典,与导出文件一起保存。这样即使原工具无法再打开,也能判断某一列究竟是排名、到达率还是页面浏览,而不是凭列位置猜含义。
这两种原因对应的保存动作不同。若文件损坏,重点是尽快从备份或旧机器复制可读副本;若工具本身已不可用或不再维护,重点是抢救字段说明,而不是继续寻找原软件。
假设有一个名为 A 的旧导出包,包含 CSV 和一个说明文件。CSV 能打开,但说明文件指向的本地帮助页面已经打不开。此时可判定为“工具不可用”而非“文件损坏”,下一步应优先从 CSV 表头和旧截图恢复字段含义。
字典至少覆盖四类信息:字段原名、中文含义、单位和取值方向。取值方向尤其容易被忽略,因为排名类字段通常是数值越小越靠前,而访问量类字段是数值越大越高,二者混在一起会导致后续解读完全相反。
这样做的直接结果是:以后即使只拿到一份脱离原工具的表格,也能通过表头反查字典。若字典里缺少“空值含义”一列,下一步应回到旧邮件、工单或截图里补,而不是先做数据汇总。
不要一上来就对全量数据做趋势判断。先取少量行,按字典解释每一列,再与当时保存的截图、邮件摘要或人工记录对照。能对上,说明字段含义基本可靠;对不上,优先怀疑单位或排名方向被理解反了。
假设样本中有一列名为 rank,字典记为“名次,数值越小越靠前”。如果同一行里另一个字段名为 reach,字典记为“到达率,数值越大覆盖越广”,那么这两个字段不能放在同一张图里比较大小,因为它们的方向相反。这个动作会直接影响下一步:先统一方向,再做任何跨字段计算。
旧工具导出往往存在中途改版、字段增删或口径调整。少量样本能验证字典,但规模化后可能出现例外,例如某些行缺失、某些日期范围字段被截断,或同一表头在不同批次中含义不同。
若某批文件的 rank 列大量为空,合理原因可能是当时未采集、低于记录阈值或导出中断,不能仅凭空值就断定排名消失。此时下一步应是查该批次的采集说明,而不是把空值当成零。
字段字典、原始导出和验证样本应放在同一归档目录,并附一份简短的变更记录:谁在何时根据什么来源确认了哪一列。这样做的结果是,后续任何人接手时都能区分“原始字段”和“后来推断的含义”。
如果旧工具导出已经无法再打开,且没有可读副本,那么能保存的只有当时留下的说明、截图和邮件。此时不要根据列位置重新命名字段,而应把不确定项标为待核实。下一步是寻找同批次的其他副本,而不是先发布基于猜测的结论。