先给结论:不要按“看起来重要”挑样本,而要按“能改变你下一步动作”挑样本。把待处理对象分成退出、保留、待定三组,只对能区分这三组的页面或词做查询;每组先取少量,用结果验证分组标准是否成立,再决定是否扩大查询范围。
额度有限时,最常见的浪费是把查询用在“结果无论如何都不会改变处理方式”的对象上。比如一个旧页面,无论数据好坏你都打算退出,那它就不是高信息量样本。反过来,一个页面如果数据好就保留、数据差就退出,它才是能推动决策的样本。
具体做法:打开你手里的资料或页面清单,为每一行补一列“查询后我会做什么”。如果这一列写不出两种不同动作,就先不查。这个动作的结果是,你的候选样本会从整张表缩小到真正有分歧的部分,下一步的查询预算才有明确用途。
把候选对象按当前判断分成三组,每组各取少量样本,而不是平均分配额度:
假设你手上有100个旧页面,额度只够查20个。如果按流量排序取前20,你得到的多半是“保留组”的确认,信息增量很低。若从待定组取10个、退出组和保留组各取5个,你更可能发现分组标准本身是否可靠。这里的数字只是说明分配方法,不代表任何工具的实际额度。
同一组内也要排序,优先选能产生可区分证据的对象:
如果一批样本查完,所有对象的结果都差不多,先别急着扩大查询。这可能是样本选得太同质,也可能是这批对象本身就没有分歧。此时应回到分组标准,换一组待定对象再试,而不是把额度继续投在同一类样本上。
假设你要处理一批旧合作关系留下的内容页面,计划退出大部分、保留少数。先取待定组中5个页面查询,记录每个页面落在“明显该退”“明显该留”“仍然说不清”哪一类。如果5个里有3个以上仍然说不清,说明你的分组标准太粗,应先细化标准,而不是继续查询。如果多数能明确归类,再用同样方法扩大样本量。
这个动作的关键在于:查询结果不是终点,而是用来检验你的判断规则。规则没通过检验时,扩大查询只会放大不确定性;规则通过后,扩大查询才有意义。具体工具的额度、字段和更新情况需要以你实际使用的工具说明为准,本文不假设任何品牌的现行功能。
样本查询结束后,为每个对象写出一个动作,并注明依据来自哪条证据。动作建议控制在四类:保留并继续维护、退出并移除、合并到其他对象、暂时搁置等待更多信息。搁置项要写明再次评估的条件,否则它会重新变成待定组,消耗下一轮额度。
最后检查一遍:如果某个对象的动作和查询前完全一样,且你本来就没有分歧,那它不该占用本轮额度。把额度留给能改变动作的对象,才是查询额度有限时最实际的挑选原则。