中文

面向对话代理的多模态策略内化

计算与语言 2026-04-21 v2 人工智能

摘要

现代对话代理(如ChatGPT和Alexa+)依赖预定义策略来指定元数据、响应风格和工具使用规则。随着这些基于LLM的系统扩展以支持多样化的业务和用户查询,此类策略通常以上下文提示实现,正变得日益复杂和冗长,导致忠实遵循困难并施加高昂的固定计算成本。随着多模态代理的兴起,调控视觉和多模态行为的策略至关重要但仍研究不足。此前的提示压缩工作主要缩短任务模板和演示,而现有的策略对齐研究仅关注基于文本的安全规则。我们提出多模态策略内化(MPI),一种将推理密集型多模态策略内化到模型参数中的新任务,使模型在推理时无需包含策略即可实现更强的策略遵循能力。MPI提出了独特的数据和算法挑战。我们构建了两个涵盖合成和真实世界决策与工具使用任务的数据集,并提出TriMPI——一个三阶段训练框架。TriMPI首先通过持续预训练注入策略知识,然后进行监督微调,最后应用PolicyRollout——一种GRPO风格的强化学习扩展,通过策略感知的响应增强rollout以实现基于地面的探索。TriMPI在端到端准确率、泛化性和抗遗忘鲁棒性方面取得了显著提升。作为多模态策略内化的首项工作,我们提供了数据集、训练方案及全面评估以促进未来研究。项目页面:https://mikewangwzhl.github.io/TriMPI。

关键词

引用

@article{arxiv.2510.09474,
  title  = {Multimodal Policy Internalization for Conversational Agents},
  author = {Zhenhailong Wang and Jiateng Liu and Amin Fazel and Ritesh Sarkhel and Xing Fan and Xiang Li and Chenlei Guo and Heng Ji and Ruhi Sarikaya},
  journal= {arXiv preprint arXiv:2510.09474},
  year   = {2026}
}