一句“开大留闪”,通用转写可能写成什么

先看一个示意场景:一场直播里,解说员用很快的语速说出“他先交了位移,对面没留控制,直接开大,留闪绕后拆包”。对通用语音转文字来说,这一句里几乎每个关键词都是陷阱:“位移”“控制”“大”“闪”在日常语境里是完全不同的意思,“拆包”更是很少出现在普通语料里。识别系统按日常语言的概率来选词,就会倾向于写出最“通顺”的日常句子,而不是最贴近比赛的那一句。

这正是电竞字幕与普通语音转文字最根本的区别:通用模型优化的是一般口语的平均表现,而电竞解说是一种高度专业化、语速极快、信息密度很高的口语。要让字幕可用,就得让识别系统知道“现在在说什么比赛”。

语音输入01降噪分离02词典偏置03上下文纠错04字幕上屏05
图:实时字幕从语音输入开始,经降噪与说话人分离、词典偏置识别、上下文纠错,最终在约1至3秒内上屏,并可对已显示内容做二次修订。

五个难点,叠在一起才是真正的难

把电竞字幕的挑战拆开看,每一项单独都能处理,难的是它们同时出现。

  • 游戏术语(Game Terminology):技能名、装备名、地图点位、战术黑话,往往不在通用词表里,并且同音或近音词很多。
  • 选手与战队名(Player Name):多为外文、缩写、谐音或自造词,同一个名字在解说口中还可能有多个叫法。
  • 极快语速(Rapid Speech):团战高潮时解说员语速陡增,吞音、连读增多,模型一旦落后就会一路跟不上。
  • 多说话人(Multiple Speakers):双人解说抢话、嘉宾插话,说话人切换频繁,转写容易串行。
  • 噪声(Noise):现场观众欢呼、背景音乐和音效,会盖过解说的辅音,让识别错得不成样子。

这也意味着,只靠换一个更大的通用模型,收益有限。PA真人的做法是把比赛已知的信息,尽早告诉识别系统。

自定义词典与上下文偏置:先把名字交给模型

ASR(自动语音识别)里通行的做法,是提供自定义词典:把选手名、战队名、地图名和常用术语作为“热词”,让识别时对这些词给予更高的先验。它的作用是把“开打留山”这种概率高但不合语境的候选,压到“开大留闪”之下。

更进一步是上下文偏置:词典不是一成不变的,而是随比赛动态调整。比赛开始前,可以按赛程和阵容加载当场的选手名单、战队名与所选英雄或角色;比赛进行中,根据场上局势提高相关词的权重,例如出现“目标物”相关事件后,提高“拆包”“防守”“回防”等词。PA真人的设计思路,是把比赛数据里的名单、阵容与事件当作偏置来源,让字幕系统知道“此刻场上有什么”,而不是让它盲听。与之配套的,是解说风格的理解,可以参考AI自动解说的观察。

双通道:解说和队伍语音不该混在一起

直播场景里其实有两种完全不同的语音:一种是解说员对观众说的话,语速快、表达完整、面向理解;另一种是队伍内部的语音,句子短促、省略主语、含有大量地图代号与缩写,比如“二楼有人,先别推”。把它们混进同一个识别模型里,效果都会打折。

PA真人平台把它们分成两条通道:解说通道使用面向观众的词典与较强的标点、断句能力,队伍语音通道则使用更偏地图点位和指令的词典,并且要注意授权与隐私,例如队伍语音是否允许对外公开,这需要遵循赛事与平台的规则,而不是由字幕系统自行决定。两条通道的字幕在版面上也应区分,避免观众把队内口令当成解说。

延迟与稳定:1–3秒里的取舍

实时字幕的延迟通常做到说完后 1–3 秒上屏。这并不是越短越好:识别系统在句子说完之前给出的是“临时结果”,随着后续内容出现,前面的词可能被改写。延迟太短,字幕会不停跳变,观众读着读着发现前一个词换了,体验很差;延迟太长,字幕又跟不上画面,团战已经结束,字幕才说到开团。

常见的折中,是分层输出:先以较低延迟给出临时字幕,用较浅的颜色或不显眼的方式标记;等语句稳定后,再替换成确认版本。同时设定“稳定窗口”,对已经确认的词不再随意改动,只在出现明显错误时才做二次修订,例如上下文里出现了选手名,回头把前面的谐音写法纠正。这样字幕既足够快,也不会让观众感到“一直在闪”。另外,若字幕要与直播高光片段配合回放,还需要把修订后的版本一并写入,避免回放里出现旧的错字。

新版本,新词:字幕系统也要跟着更新

游戏更新带来的不只是数值变化,还有新的角色、道具、地图点位和玩家给它们起的绰号。这些词出现的第一周,往往也是解说最频繁使用的时候,识别系统却完全没见过。因此PA真人的词典有专门的更新机制:版本公告与内容更新发布后,尽快把新增名称和常见叫法加入,同时保留旧名称,因为解说员和观众不一定马上改口。

还有一条经验:字幕系统应当记录“被纠正的词”。当编辑或观众反馈某个词写错,就把这个纠正写入词典,让下一场比赛不再犯同样的错。这比一次性追求很高的初始准确率更现实,也更符合直播这种持续运营的场景。

小结电竞字幕难在词、速度和声音环境的叠加。可行的路线是自定义词典加动态上下文偏置,解说与队伍语音分通道,延迟控制在 1–3 秒并配合二次修订,再随游戏版本持续维护新词。它不是一次性的模型选择,而是长期运营。