字幕只是起点:术语和人名先把通用识别打败
普通语音转文字模型在直播间里常常翻车:解说语速快,选手名和战队名是生造词,技能与道具名每次补丁都会新增,再加上现场噪声和多人抢话。通用做法是给识别系统配置自定义词典,把选手名、战队名和游戏术语作为高优先级词汇,并结合上下文偏置让模型更倾向选择“合理的电竞词”。这也是 PA真人在直播场景里首先要解决的问题,实时字幕为什么更难 一文里展开的主题。
延迟是另一个取舍。字幕出得越快,越容易出错;等得越久,观众越觉得脱节。公开的实践里,说完后 1 至 3 秒上屏是比较常见的目标,之后允许系统对前一两句做二次修订。这里的关键是稳定:字幕反复大幅跳动,比晚一秒更让人分心。
实时剪辑:从找击杀到理解上下文
2025 至 2026 年,多模态视频理解的进步让实时精彩片段生成具备了工程可行性。主流系统融合三类信号:视觉识别动作,例如击杀提示、技能释放;音频,观众声或解说声的峰值;以及结构化实时数据,例如比分、经济、场上人数。再叠加时间上下文,系统才能判断一段画面是“热闹”还是“重要”。
假设一局里出现两次同样的三杀,一次发生在领先 8000 经济的时候,另一次发生在落后局面下将比赛拉回均势。只数击杀的系统会把两者等同处理,理解上下文的系统则会把后者排在前面,并把片段起点提前到那次转点出现之前。以上为示意场景,但这正是 华丽操作与改变结果的区别 所要解决的问题。事件重要性的一个行业参考是胜率变化:Riot 与 AWS 在 2023 年英雄联盟全球总决赛转播中上线机器学习“胜率”统计,每秒更新一次,说明“事件重要性约等于胜率变化”的思路已有公开的落地。
辅助解说:先分清“说什么”的三层
AI生成游戏解说的综述(arXiv 2506.17294)把解说能力分成三层:实时观察对应描述性解说,说的是“刚才发生了什么”;战略分析对应分析性解说,说的是“这件事为什么重要”;历史回顾对应背景解说,说的是“这与之前的比赛有什么关系”。综述同时指出,现有研究比较零散,准确性与及时性是核心难点。
这与直播实践吻合。只做第一层的AI解说很容易变成一直复述画面,观众看得见的东西它再说一遍,没有增量信息。真正的难点是判断“现在什么最值得说”,甚至判断此刻是否应该沉默。PA真人的做法是让解说模块读取与高亮、字幕相同的事件时间线,先按事件重要性排序,再决定用哪一层来说,可参考 AI解说的三层结构。
速度与真实性之间的取舍
直播场景把每个错误放大了。字幕认错选手名会误导观众,高亮选错片段会浪费回放位,解说说错局势则直接损害可信度。几个常见的风险如下。
| 环节 | 常见误判 | 缓解方向 |
|---|---|---|
| 字幕 | 多说话人重叠、新术语未入词典 | 词典随补丁更新,保留二次修订 |
| 高亮 | 只看击杀数量,忽视比赛上下文 | 引入结构化事件与胜率变化 |
| 解说 | 重复描述画面,或对局势做过强断言 | 先排序再发言,措辞带依据 |
| 延迟 | 直播延迟叠加推理延迟,片段已过时 | 设定延迟预算,超时则放弃输出 |
PA真人更稳妥的原则是宁可晚发、少发,也不发没有依据的内容:每条输出附带对应的事件时间点,方便运营者快速核查。
接下来的走向
可以预期的变化有三点:字幕、高亮、解说不再是三个独立功能,而是共享同一条事件时间线;解说会按观众类型区分,对新观众补背景,对老观众少讲常识;系统会更明确地区分直播现场的实时辅助与赛后精编,两者的延迟预算和容错标准并不相同。