字幕只是起点:术语和人名先把通用识别打败

普通语音转文字模型在直播间里常常翻车:解说语速快,选手名和战队名是生造词,技能与道具名每次补丁都会新增,再加上现场噪声和多人抢话。通用做法是给识别系统配置自定义词典,把选手名、战队名和游戏术语作为高优先级词汇,并结合上下文偏置让模型更倾向选择“合理的电竞词”。这也是 PA真人在直播场景里首先要解决的问题,实时字幕为什么更难 一文里展开的主题。

延迟是另一个取舍。字幕出得越快,越容易出错;等得越久,观众越觉得脱节。公开的实践里,说完后 1 至 3 秒上屏是比较常见的目标,之后允许系统对前一两句做二次修订。这里的关键是稳定:字幕反复大幅跳动,比晚一秒更让人分心。

语音字幕01多信号高亮02事件理解03辅助解说04延迟校验05
图:直播AI的能力从语音字幕出发,依次扩展到融合多路信号的高亮检测、事件理解和辅助解说,每一步都要经过延迟与真实性的校验。

实时剪辑:从找击杀到理解上下文

2025 至 2026 年,多模态视频理解的进步让实时精彩片段生成具备了工程可行性。主流系统融合三类信号:视觉识别动作,例如击杀提示、技能释放;音频,观众声或解说声的峰值;以及结构化实时数据,例如比分、经济、场上人数。再叠加时间上下文,系统才能判断一段画面是“热闹”还是“重要”。

假设一局里出现两次同样的三杀,一次发生在领先 8000 经济的时候,另一次发生在落后局面下将比赛拉回均势。只数击杀的系统会把两者等同处理,理解上下文的系统则会把后者排在前面,并把片段起点提前到那次转点出现之前。以上为示意场景,但这正是 华丽操作与改变结果的区别 所要解决的问题。事件重要性的一个行业参考是胜率变化:Riot 与 AWS 在 2023 年英雄联盟全球总决赛转播中上线机器学习“胜率”统计,每秒更新一次,说明“事件重要性约等于胜率变化”的思路已有公开的落地。

辅助解说:先分清“说什么”的三层

AI生成游戏解说的综述(arXiv 2506.17294)把解说能力分成三层:实时观察对应描述性解说,说的是“刚才发生了什么”;战略分析对应分析性解说,说的是“这件事为什么重要”;历史回顾对应背景解说,说的是“这与之前的比赛有什么关系”。综述同时指出,现有研究比较零散,准确性与及时性是核心难点。

这与直播实践吻合。只做第一层的AI解说很容易变成一直复述画面,观众看得见的东西它再说一遍,没有增量信息。真正的难点是判断“现在什么最值得说”,甚至判断此刻是否应该沉默。PA真人的做法是让解说模块读取与高亮、字幕相同的事件时间线,先按事件重要性排序,再决定用哪一层来说,可参考 AI解说的三层结构

速度与真实性之间的取舍

直播场景把每个错误放大了。字幕认错选手名会误导观众,高亮选错片段会浪费回放位,解说说错局势则直接损害可信度。几个常见的风险如下。

环节常见误判 缓解方向
字幕 多说话人重叠、新术语未入词典 词典随补丁更新,保留二次修订
高亮只看击杀数量,忽视比赛上下文 引入结构化事件与胜率变化
解说重复描述画面,或对局势做过强断言先排序再发言,措辞带依据
延迟 直播延迟叠加推理延迟,片段已过时设定延迟预算,超时则放弃输出

PA真人更稳妥的原则是宁可晚发、少发,也不发没有依据的内容:每条输出附带对应的事件时间点,方便运营者快速核查。

接下来的走向

可以预期的变化有三点:字幕、高亮、解说不再是三个独立功能,而是共享同一条事件时间线;解说会按观众类型区分,对新观众补背景,对老观众少讲常识;系统会更明确地区分直播现场的实时辅助与赛后精编,两者的延迟预算和容错标准并不相同。

小结直播AI的进展并不在于“说得更快”,而在于理解得更深:从把话转成字,到判断哪些瞬间值得回放,再到决定什么值得说。其中每一步都受延迟与真实性约束,PA真人把这些能力视为对内容团队的辅助工具,最终输出仍应由人来把关。