文字战报回答了“结果”,没回答“过程”

先看一个示意场景:一局比赛结束后,文字战报写着“B 队通过一次成功的侧翼包抄赢下关键团战”。这句话没有错,却几乎没有可用信息。侧翼是怎么打开的?是因为 A 队上一波技能交完,还是因为 A 队的一名成员在地图另一侧被牵制?包抄发起前,B 队语音里有没有人提前喊出“对面没大招”?这些都是战报里没有的细节,而恰恰是教练会追问的部分。

文字战报是别人总结之后的结果,压缩率很高,也带着总结者的偏见。把它当作大模型的唯一输入,等于让一位从没看过比赛的人去评论比赛:语言可以很漂亮,判断却是二手的。要让AI真正“懂比赛”,输入就得回到比赛本身——它每一秒都在产生画面、声音、数据和观众反应。

画面语音Telemetry聊天时间对齐融合电竞理解
图:画面、语音、Telemetry 与聊天四路信号先按时间戳对齐,再汇入统一的电竞理解层,输出可回溯到具体时刻的分析结论。

每种模态各负责一块

不同信号讲述的是同一场比赛的不同侧面,也各有各的盲区。把它们放在一起看,才能看出哪一块信息该信谁。

模态提供什么 只靠它会漏掉什么
画面 Video 视野、空间关系、走位与技能特效,能补足没有服务端日志的场景看不到血量精确值、冷却时间,被遮挡时会“看走眼”
语音 Audio 意图、沟通节奏、决策发起的时机,例如喊出转点的那一秒 多人重叠时难分说话人,口令常常省略主语与地点
Telemetry 精确的位置、血量、经济、技能与冷却状态 只有数值,看不见“为什么这么走”
聊天 Chat观众对片段的反应,反映事件的“显著程度” 滞后、刷屏、玩梗,不能当作事实来源

可以看出,画面负责“看见了什么”,Telemetry 负责“精确是多少”,语音负责“想做什么”,聊天负责“别人觉得多重要”。任何一路单独使用,都只能回答问题的一部分。比如“选手为什么在那个位置停下”,答案往往要在画面的视野、Telemetry 的冷却状态和语音里的一句“等一下”之间三方印证。

比模型更难的是把它们对齐到同一条时间线

多模态最不起眼、却最容易出错的环节,是时间对齐。游戏内事件的时间戳来自服务端,直播画面有编码与传输延迟,语音是另一条链路,聊天又是第三条。假设画面比 Telemetry 晚两秒,语音比画面早一秒,那么“喊话—转点—击杀”这条因果链,在数据里会被排成“击杀—喊话—转点”,任何依赖顺序的推理都会得出相反的结论。

所以PA真人在工程上先做一层同步:用共同的锚点事件(比如开局计时、明确的击杀提示音与画面文字)估算各路的偏移,再把所有信号映射到统一的比赛时钟。这一层做扎实了,后面的融合才有意义。关于编码器如何各自处理不同模态、再怎么合并,可以参考多模态输入那篇的展开,这里只强调一点:对齐不是预处理的小事,而是整个系统可信度的地基。

基准告诉我们:通用视频大模型还不够

有人会问:现在的视频大模型已经能看视频,直接把整段录像丢给它不就行了?公开基准 EgoEsportsQA(arXiv 2604.12320)提供了一个冷静的答案。它覆盖 3 款第一人称射击游戏,收集了 1745 条职业比赛问答,含 11 项认知子任务和 6 项电竞知识子任务;当时表现最好的 Video-LLM 只有 71.58%。更有信息量的是错误的分布:模型在基础感知上强于深度战术推理,对宏观进程强于微观操作。

换成人话:它比较擅长认出“有人被击杀了”“这个区域发生了交火”,却不擅长回答“这次击杀为什么是被迫的”“他有没有更好的站位”。这与电竞画面的特点直接相关:画面变化极快,信息密度很高,界面元素小而密,关键线索(一格血量、一个技能图标、小地图上的一个点)往往只占几个像素。指望通用模型在这些细节上稳定读对,风险很大。

PA真人的思路:专用感知加大模型统筹

PA真人的设计思路是把“看清楚”和“想明白”分成两个环节。前一个环节由专用模型承担:检测器读取血条、小地图与击杀提示,事件模型把 Telemetry 变成结构化的“事件—状态”序列,语音链路做带游戏词典的转写。公开研究也支持这个方向,比如 Dota 2 小地图可见性分析的论文,用 144 场比赛、2477 张人工标注的小地图图像训练检测器,就能画出“各方看得见什么”的可见性曲线。

后一个环节才交给大模型:它拿到的不再是原始画面,而是带时间戳的结构化事件、状态摘要和必要的关键帧,负责统筹上下文、关联因果、生成解释与建议。这样做有两个好处:其一,大模型在自己擅长的语言推理上发力,不必硬扛像素级的感知;其二,每条结论都能回溯到具体事件与证据,方便教练复核。战术特征也比原始画面更有用,公开的 VALORANT 回合结果预测研究(预印,初步结果)就显示,加上战术事件标签后,模型在回合中后段的预测准确率约 81%,明显好于只用原始小地图。

另一个现实问题是比赛很长。一场完整录像动辄几十分钟,全部塞进上下文既贵又容易“忘”,因此还需要事件时间线与检索式记忆,把重要片段留下来,见长上下文的讨论。PA真人平台把这些能力作为大模型的“工具与记忆”,由统一的上下文层调度,而不是让一个大模型独立处理所有输入。

技术边界:哪些地方仍会出错

多模态并不意味着更准,它引入了新的失效方式。其一,遮挡与界面差异:不同游戏版本、观战界面与皮肤,会让检测器失灵;其二,补丁与地图版本变化,会让基于历史数据训练的事件定义过时;其三,语音多人重叠、口音、术语更新,会让转写错位;其四,缺失模态:某路信号中断时,系统需要明确降级,并把“这条结论缺少语音支持”告诉使用者,而不是悄悄补一个看起来合理的答案。

还有隐私与合规问题。语音与生理类信号属于敏感数据,采集要有明确授权与最小化原则;至于用赛前语音声学去预测比赛结果之类的研究,目前仍属早期探索,不宜当作可靠手段。总体上,多模态系统的输出应被理解为参考与辅助判断,尤其在没有充足样本的新版本里。更宏观的行业趋势,可以看多模态电竞分析的近期动向

小结文字战报是被压缩后的结论,多模态系统要读的是过程:画面给空间,语音给意图,Telemetry 给精确状态,聊天给反应,时间对齐把它们串成同一条时间线。通用视频大模型在战术推理与微观操作上仍有短板,更稳妥的路线是专用感知模型打底、大模型统筹,并让每条结论都能回溯到证据。