同一个模型为什么会“样样都会,样样勉强”

先把四类任务的要求摆在一起。直播字幕与高亮,要在一到三秒内出结果,错了要能快速修订;实时战术提示,需要在决策窗口内给出简短建议,并附带置信度;赛后复盘,可以花更多时间,但每条结论要能回到具体时刻;训练建议,要解释“为什么建议你练这个”,并考虑长期的能力轨迹。四类任务对延迟、精度、可解释性的取舍完全不同,不存在一个统一的最优点。

大语言模型擅长组织语言、跨材料综合,但在高速游戏画面里读取血条、小地图上的图标,并不是强项,公开基准 EgoEsportsQA 里最好的 Video-LLM 也只有 71.58%,而且基础感知强于深度战术推理。反过来,专用检测器读小地图很准,却不会写复盘报告。所以分工并不是为了复杂,而是承认每种模型的长处与短板,PA真人AI大模型也是按这个思路分层的。PA真人的做法是把大模型放在“统筹与表达”的位置,而不是让它替代每一个专用组件。

任务请求路由器专用模型统一上下文融合评估回退
图:请求先经路由器判断任务类型与预算,分发给视觉、Telemetry、事件、推荐或大语言模型,共享统一上下文,并由评估与回退机制兜底。

五类模型各管什么

模型 擅长 典型任务 主要短板
Vision Model(视觉模型) 读取画面里的图标、血条、击杀提示 小地图识别、OCR、目标追踪 遮挡与界面差异,不理解战术含义
Telemetry Model 处理精确的位置、状态、资源序列 状态预测、技能模型、疲劳信号分析 依赖数据接口,缺失时无法工作
Event Model(事件模型) 识别、去重、排序比赛事件 关键事件检测、高亮打分依赖上游抽取的准确性
Recommendation Model把玩家画像与训练内容匹配 训练任务推荐、计划调整样本少时容易过拟合
LLM(大语言模型) 综合材料、解释、对话式表达 复盘报告、解说、问答 较慢、较贵,易出现幻觉

这五类并不是并列关系,而更像流水线上的不同工位:视觉与 Telemetry 模型负责把世界变成结构化数据,事件模型负责挑重点,推荐模型负责把重点变成行动,大语言模型负责用人话讲清楚。这与 多模态输入 里“先独立编码、再融合”的思路一脉相承。

路由怎么做:任务、预算与置信度

模型路由不是简单的“if 直播就用快模型”。它通常考虑三件事:任务类型,决定需要哪些专用模型;延迟预算,决定能不能等重模型;置信度,决定要不要升级到更强的模型或让人复核。举个示意场景:一次疑似精彩片段,事件模型给出 0.85 的分数,直接上屏为候选;分数在 0.5 到 0.7 之间,交给视觉模型二次确认;赛后复盘时,同一个事件才会交给大语言模型写成带解释的卡片。

路由策略有几种常见写法:规则式,按场景写死,可解释但不灵活;分类器式,让一个小模型判断该走哪条路;级联式,先用便宜的模型,不确定再上贵的。PA真人的实践往往是规则加级联的组合,因为规则容易审计,级联能省算力。要注意的是,路由器本身也会错,比如把复杂问题误判成简单问题,因此需要在评估里单独统计路由的准确率,而不只看最终答案。

统一上下文层:让各模型看同一份比赛

模型分工以后,最容易出的问题是“各说各话”:视觉模型认为选手在 A 点,Telemetry 显示在 B 点,事件模型却记了另一个时间。解决办法是一层统一的比赛上下文:同一个时间轴、同一套实体命名(选手、地图区域、技能)、同一份事件记录,所有模型都往里写、从里读。这层与 长上下文的事件记忆 天然相通,可以合并设计。

PA真人平台的设计思路是,把上下文层当作各个模型之间的“共同语言”,而不是让它们直接互相调用。这样替换某一个模型,比如升级视觉检测器,只要输出格式不变,其他部分不必改动;出现分歧时,也能在上下文层里核对是谁的记录与事实不符。

评估与回退:模型也会出问题

分工带来了灵活,也带来了更多故障点。评估需要分层:每个模型有自己的指标,如检测的召回与误检、事件排序质量、推荐后的实战改善;系统层还要看端到端的延迟与一致性。特别是路由后的整体表现,不能只看单模型准确率,否则会出现“每个模块都很好,合起来却不通顺”的情况。

回退机制则是让系统在部分失效时依然有用。视觉模型读不到小地图,就退回只用 Telemetry;Telemetry 缺失,就改用画面检测并降低置信度;大语言模型超时,直播链路就直接输出结构化事件卡片,稍后再补文字解释。回退时要明确告知使用者:这一条来自较弱的信息源,只作参考。这一点也符合“建议、参考、辅助判断”的原则,AI 不该对没有证据的结论显得太笃定。

小结训练、战术、复盘和直播不该全交给同一个模型,是因为它们对延迟、精度和可解释性的要求不同。更稳的结构是专用模型分工、路由器分发、统一上下文对齐,再加上评估与回退兜底。大模型负责统筹与表达,专用模型负责看清和算准。