3月17日凌晨两点从篇,某省级通讯社值班编辑老周盯着屏幕上跳动的预警提示是系统标记出过去四小时内有217篇报道涉及同一事件,叙事口径出现了明显分歧。他点开新闻文本分析的聚类结果图稿里。红色节点集中在「赔偿金额」和「责任主体」两个维度上。这不是第一次了,这次数据量比去年翻了一倍。新闻文本分析这套东西,说白了就是从成堆的捞出路径稿子里找规律。词频、语义向量、传播路径了,三样交叉跑一遍,哪篇稿子在偷换概念、哪条信源被反复引用却从来没有核实呢真相?基本八九不离十。

老周他们团队用的模型是去年底刚更新的,能识别方言土话里的隐含情绪是条新这在以前纯靠人盯的时候。差点就漏了。

小陈有天跟我吐槽,说跑一轮完整分析要三十七分钟,「够我刷两集短剧了」。问题也有闻文的。上个月某次食品安全舆情。新闻文本分析系统把几篇带强烈情绪渲染的自媒体稿子权重拉得太高吧?最初四十八小时的判断偏了整整一个方向。

复盘才发现本分,那些稿子的转发链路是机器刷出来的。技术能读文本,读不出「谁在背后点过几千个赞」啊?这件事之后实操。团队在管线里多加了一道信源可信度过滤。多花了两周才调通。「我们不是让机器替人下结论。

」小陈说这话时正啃着半个三明治,嘴里还含糊不清。

「它负责把三千篇压到三十篇里,剩下的是人的活儿。」她指的是人工核查环节是新闻文本分析给出的概率分布只是起点,真正拍板的是记者拿电话、跑现场那一步。老周听完没接话,把咖啡续上了。窗外天快亮了。老周关掉预警页面,今天还有两个采访约在上午十点。屏幕暗下去之前,新闻文本分析的。最后一条日志静静停在角落,「建议关注『第三方检测』相关表述在夜间时段出现频率异常上升。」他没动那条提示的。

不急,白天再说。