玩家推开一扇门,守卫需要在几十毫秒内决定是转身还是拔剑,接着在一两秒内说出一句得体的话,而整个章节的剧情要不要重排,几分钟以后再决定也来得及。这三件事的时间尺度相差三个数量级,如果都交给同一个云端大模型,要么守卫永远慢半拍,要么每句台词都在为最大的模型付费。游戏AI越来越需要“模型路由”(Model Routing),也就是一个专门决定“这件事由谁来做”的调度层。

路由并不是新发明。行业里已有厂商公开过类似思路:英伟达的ACE自主游戏角色方案(2025年)使用8B、4B、2B级的小语言模型做角色决策;据英伟达技术博客介绍,KRAFTON在PUBG Ally中把2B模型部署在玩家本机以压低延迟,并让行为树负责战斗动作、语言模型负责推理与说话。下面沿着PA真人游戏大模型研究组的思路,把这个调度层拆开来看。

先看任务,而不是先看模型

游戏里的AI任务可以粗分成五档,每一档对延迟、成本和质量的要求都不同。

任务 示例延迟目标质量要求 推荐执行者
帧内决策(移动、躲避) 小于16毫秒 稳定、可预测 规则引擎与行为树
短句对话 约300到800毫秒起播 口吻自然、设定一致 端侧小模型
剧情规划 数秒到数十秒 结构完整、前后呼应 云端大模型
案件与谜题生成可预生成,分钟级 可解、无矛盾 云端大模型加校验
一致性校验 随请求同步 零容忍事实冲突 规则引擎加检索

表中所有延迟数字都是示例参数,用来说明量级,并非任何产品的实测结果。重要的是这张表反映的判断:越靠近玩家的操作,越需要确定性;越靠近内容创作,越需要大模型的语言能力。而“一致性校验”这一行提醒我们,最需要可靠的地方,往往一个语言模型都不该出现。

左侧四张任务卡片进入中央六边形路由器,再分流进规则引擎、端侧小模型、云端大模型和检索库四条管道。
这张图说明:模型路由按任务类型把请求分给最合适的处理者,而不是让一个大模型包办一切。

路由器看哪些信号

路由器每次拿到请求,会综合几类信息。任务类型是第一位的;其次是上下文长度,示例参数:超过4000个词元的上下文不适合端侧小模型;再次是玩家设备,比如显存和电量;最后是网络状况,网络往返超过示例阈值时,本来该上云的对话会退回端侧。还有一类容易被忽略的信号是“重要程度”:主线关键剧情节点值得多花一点成本,路边行人的一句问候则不值得。

路由规则早期用手写条件就足够,比如“对话且上下文小于2000词元且端侧可用,选小模型”。规则变多以后,可以再用一个很小的分类器学习路由,但它必须被规则兜底:分类器的置信度低于示例阈值时,走更保守的路径。

一次NPC对话的路由决策(示例)

玩家走到铁匠铺,问铁匠“昨天那批剑修好了吗”。路由器的处理大致是这样的:

  1. 识别任务:这是一句带世界状态依赖的短对话。先向世界状态查询“昨天那批剑”的任务状态,这一步是检索,不调用任何模型。
  2. 检查缓存:相似问题在最近对话中出现过吗?如果玩家上次问过同样的问题且状态未变,直接复用上次的要点。
  3. 选择执行者:状态查询显示剑已修好、并有一条关于报酬的关系记录,属于低风险短对话,交给端侧小模型,示例目标是首字延迟不超过500毫秒。
  4. 校验输出:规则检查器核对台词里是否出现了状态里没有的物品或数字,不通过则重试一次。
  5. 降级兜底:如果端侧模型超时,返回一条预写的模板台词并在后台异步补生成更丰富的版本。
  6. 记录日志:任务类型、所选执行者、延迟、是否重试都写入路由日志。

如果玩家换一种问法,比如“你觉得我该去帮北边的村子还是留在城里”,任务性质就变了,涉及剧情倾向与多个任务分支,路由器会把它判定为规划类,转给云端大模型,并允许玩家看到一个短暂的“铁匠正在思考”的表现,以此掩盖秒级的等待。

识别任务检查缓存选择执行者校验输出降级兜底记录路由日志
路由器处理一次请求的顺序:先判断是否能不调用模型,再决定用哪一档模型,失败则退回更保守的方案。

缓存、预生成与降级

许多请求可以提前处理。玩家进入新区域前,云端可以预先生成一批可能用到的NPC对话要点与区域描述,放入本地缓存;夜间或后台空闲时,还可以预生成下一段主线的候选走向。缓存的关键是失效条件:世界状态里相关实体的版本一旦改变,对应缓存立即作废,否则守卫会对已经不存在的事情侃侃而谈。这一点与世界状态管理里的版本号机制是同一套逻辑。

降级则要预先设计成多档:云端不可用退到端侧,端侧模型过载退到模板,模板也不适用就退到沉默或简短动作。玩家不应该看到错误提示,只会觉得角色少说了几句。

没有观测,就没有路由

分流是否合理,最终要靠数据回答。路由日志需要记录每次请求的任务类型、执行者、延迟、成本、校验是否通过,以及玩家是否在这一轮之后有明显的负面反馈,比如连续跳过对话。把这些日志汇总,才能发现“本应端侧处理的短句被频繁送上云”这类浪费,也能发现小模型在某类任务上的失败率偏高。非确定性系统的评测很困难,路由策略需要结合自动评测与线上小流量实验反复调整。

路由也带来新的风险:不同模型的口吻略有差异,玩家可能感到同一个角色时而聪明时而迟钝。缓解办法是把人设与语气约束放在共享的角色档案里,而不是分别写进各个模型的提示词。更大的图景可以对照游戏世界模型一文,栏目里的其他内容则可以从PA真人AI大模型栏目继续阅读。