先给结论:咨询记录里的“条数”是次数,不是人数。要区分两者,必须能在同一份资料里把可识别的同一联系人归并成一个“人”,再把其余记录计为“次”。如果资料里只有时间、渠道和一句问题,没有任何可重复识别的字段,那么你只能报告次数,不能报告人数;强行去重会把两个真实用户误合成一个,误差方向比不去重更危险。下面以你手里那份咨询台账或后台导出表为对象,说明怎么判断、怎么改、改完看什么。
把资料摊开,只看三类字段:身份锚点、行为锚点、渠道来源。身份锚点指能跨记录指向同一个人的稳定标识,例如登录账号、会员编号、已确认的手机号或邮箱;行为锚点指时间、会话编号、咨询主题;渠道来源指这条记录从哪个入口进来。三者齐全时,归并是可行的;只有行为锚点,归并只是猜测。
判断标准可以写死:如果两条记录共享同一个稳定标识,且时间间隔在你业务可接受的窗口内,就归并为一人多次;如果标识不同但内容高度相似,不要合并,只标记为“疑似同题不同人”。这一步的动作是给每条记录打上“可归并/不可归并”标签,结果直接决定下一步能用哪套口径,而不是先算出一个漂亮的数字再解释。
不要在一列里混算。建议在原表旁新增三列:person_id(无稳定标识时留空)、contact_seq(同一 person_id 按时间排序的序号)、count_basis(取值“人数”或“次数”)。有了这三列,你可以同时输出两个数:咨询次数 = 记录总行数;咨询人数 = person_id 去重后的数量,加上所有 person_id 为空但被判定为独立个体的记录数。
关键在于空值怎么处理。假设某渠道 100 条记录里只有 60 条带稳定标识,剩下 40 条无标识。此时“人数”只能写成“至少 60 人,另有 40 条无法判定”,不能直接报 100 人,也不能报 60 人。这个写法看起来不够干脆,但它保住了可核查性,后续任何人对账都能复现。
假设某周导出 12 条咨询记录,其中 3 条来自账号 A(周一、周三、周五各一次),2 条来自账号 B,其余 7 条无标识。按次数口径是 12 次;按人数口径,确定人数为 2 人,另有 7 条待定,所以写“2 人确认,7 条未识别”。
此时若发现账号 A 的三次咨询主题从“价格”变成“交付周期”再变成“退款条件”,这不是三个人在问三件事,而是一个人的关注点迁移。这个区分会改变你的下一步:如果按人数看,你会去优化首次触达话术;如果按次数看,你会去检查同一用户在多次接触中是否被反复要求提供相同信息。两种结论对应两种完全不同的改动,前提就是归并是否成立。
当你从“按次数”切换到“按人数”,以下结论会失效,需要重算:各渠道的“咨询量排名”、单条咨询的“平均处理成本”、以及任何以“每条咨询”为分母的转化率。原因是分母变了,分子没变,比值必然漂移。重算时保留旧口径结果作为对照,而不是替换掉,这样你能看出变化是来自口径调整还是来自真实业务波动。
一个可执行动作是:在报表里固定并排展示“按次数”和“按人数”两行,并标注各自适用的决策。例如排班和响应时长用次数口径,因为工作量与接触频次相关;用户画像和复购判断用人数口径,因为同一个人重复咨询不代表多个潜在客户。哪一行用于哪类决策,写进表头备注,避免下次有人拿错口径去论证结论。
如果资料里确实没有稳定标识,正确做法不是估算人数,而是改变表述方式。可以报告“咨询次数”“独立会话数”“首次咨询占比”这类不需要跨记录归并的指标,并在结论中明确写出“本数据无法区分同一用户重复咨询”。
同时检查一个常见误判:把“同一时间段内内容相似”当作同一人。相似问题可能来自同一批投放触达的不同用户,这是渠道特征,不是身份证据。第三方估算流量、平台后台报告与站内统计对“访问”和“用户”的定义本来就不同,因此跨来源对比人数时,先确认各自口径,再决定是否可比。若不可比,就分别报告,不做减法也不做换算。最后回到你手里那份资料:先标可归并字段,再拆两条口径,再决定哪些历史结论作废重算——这三步做完,人数与次数才真正分开,后续判断才有可靠起点。