主页

MCPO: Masked and Counterfactual Policy Optimization for Agentic Model Selection

(Under Review by AAAI 2027 [CCF-A])
MCPO: Masked and Counterfactual Policy Optimization for Agentic Model Selection

给定一个用户请求与海量的候选模型仓库,MCPO 首次将智能体(Agent)的模型选择过程形式化为强化学习问题,训练一个紧凑的策略直接从结果反馈中学习,无需依赖昂贵的大模型推理即可在候选模型中挑选出最匹配的模型。

1. 概述

本文提出了 MCPO(Masked and Counterfactual Policy Optimization),一个面向智能体模型选择(agentic model selection)的强化学习框架。与现有方法把模型选择当作推理时的提示(prompting)问题不同,MCPO 首次将其建模为强化学习问题,训练一个紧凑的策略直接从结果反馈中学习,从而摆脱对冻结模型或模仿学习的依赖。

MCPO 智能体模型选择概览
图 1: 多轮智能体模型选择的概览与每轮内的微观动作空间

2. 动机与解决的问题

在构建强大 AI 智能体的过程中,从持续演化的开源仓库(如 Hugging Face)中为数百万个专用模型挑选最合适者已成为关键瓶颈。现有方法(如 HuggingGPT 等)主要依赖推理时提示,其选择逻辑仍停留在冻结模型或模仿策略中,缺乏显式的结果反馈,无法根据”所选模型是否真正满足用户请求”进行优化。

将标准强化学习直接应用于此场景会面临三大失败模式:

  • 身份记忆(identity memorization):巨大的、持续演化的候选模型池使得策略容易过拟合到模型名称本身。
  • 流行度偏置(popularity-biased exploration):采样分布过度偏向早期、流行的候选,难以探索长尾中的稀有模型。
  • 错失更优方案(missed superior alternatives):当更优模型出现在同一候选列表中时,策略缺乏信号去感知这一机会成本。

3. 核心方法

MCPO 通过三个互补机制将策略优化适配到仓库规模的模型选择场景:

动态身份掩码(Dynamic Identity Masking)

在 rollout 采样阶段,动态掩码模型身份,防止策略过拟合到模型名称。

逐轮轨迹剪枝(Round-wise Trajectory Pruning)

重新平衡 rollout 分布,将探索从早期、流行度偏置的候选扩展到后续轮次中更稀有的备选模型。

反事实优势估计(Counterfactual Advantage Estimation)

从 gold labels 直接计算优势,无需学习价值网络;当策略忽略了候选列表中的更优模型时,对其施加惩罚,从而将未选择候选的机会成本纳入策略梯度。

4. 创新性贡献

  1. 首次的 RL 形式化:首次将模型选择建模为强化学习问题,训练策略从结果反馈中优化选择质量,而非依赖冻结模型或模仿学习。
  2. 三大失败模式的系统刻画与解决:识别出标准 RL 应用于仓库规模智能体模型选择时的三种失败模式,并提出 MCPO,通过动态身份掩码、逐轮轨迹剪枝与反事实优势估计加以解决。
  3. 显著的效果与效率优势:在最大规模模型选择基准上,用 MCPO 训练的 Qwen3-8B 策略达到 84.25% 的综合得分,超过最强的免训练基线 5.21 分,并超越 GPT-5.4 等更大的闭源系统(79.04%),且推理成本远低于后者。

5. 总结

MCPO 通过动态身份掩码、逐轮轨迹剪枝与反事实优势估计,将强化学习适配到仓库规模的智能体模型选择,缓解了身份记忆、流行度偏置探索与错失更优方案三大问题。实验表明,其在小而专门的策略上即可实现领先的选择质量,为持续演化的模型仓库提供了一种可扩展、低成本且不断自我改进的模型选择范式。