先给结论:不要试图给“同名”本身找一个统一归属,而要建立一张以“主体—载体—时间”为三列的对应表,把每一个案例样本锚定到具体法人、具体发布渠道和具体时间点。当样本量小的时候,人们习惯用品牌名直接搜索并默认第一条结果是同一主体;一旦样本扩展到几十上百条,同名但不同主体的记录就会互相污染,对应表必须从“按名字归并”改为“按证据归并”。
假设你手上有二十条以同一品牌名出现的口碑案例,逐条核对时每一条都能找到出处,看起来归属清晰。把样本扩大到两百条后,问题出现了:其中一部分案例的发布账号、落地页主体、备案信息指向的是另一家公司,甚至分属不同城市、不同行业。此时如果仍按品牌名合并统计,就会把两个主体的传播效果算在一起。
这不是数据脏,而是同名现象在样本放大后必然暴露。小样本阶段你实际核对的往往只是“名字是否一致”,而不是“主体是否一致”。规模化之后,必须换一套归并规则。
面对同名不同主体,先区分两种成因,因为它们的处理方式不同。
两种解释对应两种对应表结构。历史沿革型需要增加“生效时间段”字段,注册撞名型需要增加“行业/地域”字段。如果一开始就混在一起,后面无论怎么补字段都会返工。
以下证据可以帮助判断某个同名样本属于哪一类,而不是靠猜。
一个可操作的判断动作是:先随机抽取十条同名样本,分别记录上述四类证据,再看它们是否指向同一主体。如果十条中有三条以上指向不同主体,说明对应表必须按主体拆分,不能继续按名字合并。这个动作的结果直接决定下一步是补字段还是重建表结构。
一张能用的对应表至少包含:主体全称、品牌名、行业或地域限定、渠道与账号、案例发布时间、证据来源类型、归属判定。其中“归属判定”只写三档:确认属于该主体、确认不属于、待核。不要写“可能”“大概”,模糊档位会让整张表失去筛选价值。
需要写清的边界是:这张表只能回答“某条案例记录对应哪个主体”,不能回答“哪个主体的口碑更好”。把不同主体的案例合并计算传播量、好评率或覆盖范围,在对应表建立之前和之后都是不成立的。样本量越大,合并计算带来的偏差越明显,这也是小样本结论不能直接照搬到规模化场景的原因。
假设某品牌名下有 A、B 两个主体,A 主体有五十条案例记录,B 主体有三十条。若按名字合并统计为八十条,会高估任一主体的实际声量;按主体拆分后,两个数字才各自成立。这个例子只说明归并口径的影响,不涉及任何真实品牌的实际数据。
实际操作顺序建议如下:第一步,列出所有同名主体,逐个记录登记信息与业务范围;第二步,为每条案例记录打上主体标签,无法判定的进入待核区;第三步,对待核记录逐条核对渠道主体与联系方式指向;第四步,确认对应表稳定后再做案例的横向比较或复用。
跳过前三步直接复用案例,最常见的后果是把另一主体的成绩写进自己的材料,一旦被追问出处就无法自证。对应表的价值不在于好看,而在于让每一条引用都能回溯到具体主体和具体时间。做完这一步,你才能判断哪些案例可以对外使用,哪些只能内部参考。