同一个模型为什么会“样样都会,样样勉强”
先把四类任务的要求摆在一起。直播字幕与高亮,要在一到三秒内出结果,错了要能快速修订;实时战术提示,需要在决策窗口内给出简短建议,并附带置信度;赛后复盘,可以花更多时间,但每条结论要能回到具体时刻;训练建议,要解释“为什么建议你练这个”,并考虑长期的能力轨迹。四类任务对延迟、精度、可解释性的取舍完全不同,不存在一个统一的最优点。
大语言模型擅长组织语言、跨材料综合,但在高速游戏画面里读取血条、小地图上的图标,并不是强项,公开基准 EgoEsportsQA 里最好的 Video-LLM 也只有 71.58%,而且基础感知强于深度战术推理。反过来,专用检测器读小地图很准,却不会写复盘报告。所以分工并不是为了复杂,而是承认每种模型的长处与短板,PA真人AI大模型也是按这个思路分层的。PA真人的做法是把大模型放在“统筹与表达”的位置,而不是让它替代每一个专用组件。
五类模型各管什么
| 模型 | 擅长 | 典型任务 | 主要短板 |
|---|---|---|---|
| Vision Model(视觉模型) | 读取画面里的图标、血条、击杀提示 | 小地图识别、OCR、目标追踪 | 遮挡与界面差异,不理解战术含义 |
| Telemetry Model | 处理精确的位置、状态、资源序列 | 状态预测、技能模型、疲劳信号分析 | 依赖数据接口,缺失时无法工作 |
| Event Model(事件模型) | 识别、去重、排序比赛事件 | 关键事件检测、高亮打分 | 依赖上游抽取的准确性 |
| Recommendation Model | 把玩家画像与训练内容匹配 | 训练任务推荐、计划调整 | 样本少时容易过拟合 |
| LLM(大语言模型) | 综合材料、解释、对话式表达 | 复盘报告、解说、问答 | 较慢、较贵,易出现幻觉 |
这五类并不是并列关系,而更像流水线上的不同工位:视觉与 Telemetry 模型负责把世界变成结构化数据,事件模型负责挑重点,推荐模型负责把重点变成行动,大语言模型负责用人话讲清楚。这与 多模态输入 里“先独立编码、再融合”的思路一脉相承。
路由怎么做:任务、预算与置信度
模型路由不是简单的“if 直播就用快模型”。它通常考虑三件事:任务类型,决定需要哪些专用模型;延迟预算,决定能不能等重模型;置信度,决定要不要升级到更强的模型或让人复核。举个示意场景:一次疑似精彩片段,事件模型给出 0.85 的分数,直接上屏为候选;分数在 0.5 到 0.7 之间,交给视觉模型二次确认;赛后复盘时,同一个事件才会交给大语言模型写成带解释的卡片。
路由策略有几种常见写法:规则式,按场景写死,可解释但不灵活;分类器式,让一个小模型判断该走哪条路;级联式,先用便宜的模型,不确定再上贵的。PA真人的实践往往是规则加级联的组合,因为规则容易审计,级联能省算力。要注意的是,路由器本身也会错,比如把复杂问题误判成简单问题,因此需要在评估里单独统计路由的准确率,而不只看最终答案。
统一上下文层:让各模型看同一份比赛
模型分工以后,最容易出的问题是“各说各话”:视觉模型认为选手在 A 点,Telemetry 显示在 B 点,事件模型却记了另一个时间。解决办法是一层统一的比赛上下文:同一个时间轴、同一套实体命名(选手、地图区域、技能)、同一份事件记录,所有模型都往里写、从里读。这层与 长上下文的事件记忆 天然相通,可以合并设计。
PA真人平台的设计思路是,把上下文层当作各个模型之间的“共同语言”,而不是让它们直接互相调用。这样替换某一个模型,比如升级视觉检测器,只要输出格式不变,其他部分不必改动;出现分歧时,也能在上下文层里核对是谁的记录与事实不符。
评估与回退:模型也会出问题
分工带来了灵活,也带来了更多故障点。评估需要分层:每个模型有自己的指标,如检测的召回与误检、事件排序质量、推荐后的实战改善;系统层还要看端到端的延迟与一致性。特别是路由后的整体表现,不能只看单模型准确率,否则会出现“每个模块都很好,合起来却不通顺”的情况。
回退机制则是让系统在部分失效时依然有用。视觉模型读不到小地图,就退回只用 Telemetry;Telemetry 缺失,就改用画面检测并降低置信度;大语言模型超时,直播链路就直接输出结构化事件卡片,稍后再补文字解释。回退时要明确告知使用者:这一条来自较弱的信息源,只作参考。这一点也符合“建议、参考、辅助判断”的原则,AI 不该对没有证据的结论显得太笃定。