每次榜单发布,都会有人问:为什么这个话题排在前面,那个却没有。答案通常不在排名本身,而在热度值的计算方式。既然读者一再追问,我们决定把方法完整公开一次。
为什么不能直接加总浏览量
最直观的做法是把所有平台的浏览量加起来排序,但这个做法有两个致命问题。第一,不同平台的浏览量口径完全不同,直接把数字相加没有意义;第二,浏览量只反映「看到」,不反映「参与」,一个只被划过的话题和一个引发大量讨论的话题会被算成同样的分数。
三个变量与它们的权重
变量一:来源权重
我们把讨论来源分成几类,并给予不同权重。来自独立创作者的内容权重高于聚合转载,出现多个来源交叉印证的内容权重最高。这样做是为了降低单一来源反复自传播带来的虚高。
- 多来源交叉印证:权重最高
- 独立创作者发布:权重较高
- 平台内聚合转载:权重中等
- 来源不明的重复内容:权重最低
变量二:时间衰减
热度是有保质期的。我们给每一条互动记录乘以一个随时间递减的系数,让旧信息的影响力自然降低。这个系数不是线性的:前十二小时衰减很慢,之后加速,超过四十八小时基本归零。
变量三:互动质量
我们把互动分为「轻互动」和「重互动」两类。点赞、收藏属于轻互动,权重较低;带观点的评论、引用和二次创作属于重互动,权重较高。经验上,重互动占比高的话题,讨论质量也更稳定。
一个只被浏览的话题,和一个引发大量讨论的话题,不该得到相同的分数。
方法的边界
必须坦白,任何热度算法都有盲区。我们的方法对集中爆发的短期话题很敏感,但对长期缓慢发酵的话题不够敏感;对公开平台的数据覆盖较好,对半封闭社群则几乎无能为力。所以榜单只能作为观察工具,不能当作事实的全部。
我们会在每季度的复盘里公开一次参数调整记录,让读者知道排名变化有多少来自真实热度,有多少来自方法本身的变动。这是我们认为榜单应该有的透明度。