透过角色视角:解决多模态角色扮演智能体中的模态-角色干扰
计算机视觉与模式识别
2026-05-12 v1 计算与语言
摘要
多模态大语言模型 (Multimodal Large Language Models, MLLMs) 的发展将角色扮演智能体 (Role-Playing Agents, RPAs) 扩展到了视觉接地的环境中。然而,人类视觉本质上是主观的且由身份驱动的,而现有的 MLLM 为通用任务提取客观的、与角色无关的特征。在 RPAs 中,这种通用视觉噪声压倒了脆弱的角色特征,导致了模态-角色干扰 (Modality-Role Interference, MRI),即智能体难以整合视觉接地与角色一致性。为解决此问题,我们引入了免训练的角色感知视觉干预 (Character-Aware Visual Intervention, CAVI) 框架,使智能体能够透过角色的视角感知世界。CAVI 系统性地针对 MRI:在宏观层面,角色引导令牌剪枝 (Character-Guided Token Pruning, CTP) 将视觉感受野限制在与角色相关的实体上;在微观层面,正交特征调制 (Orthogonal Feature Modulation, OFM) 将令牌投影到角色上下文子空间以提取对齐的事实;在解码过程中,模态自适应角色引导 (Modality-Adaptive Role Steering, MARS) 根据视觉依赖度动态优化引导强度。大量实验表明,CAVI 有效缓解了 MRI,显著增强了角色一致的多模态交互。
引用
@article{arxiv.2605.09443,
title = {Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent},
author = {Yihong Tang and Kehai Chen and Xuefeng Bai and Min Zhang},
journal= {arXiv preprint arXiv:2605.09443},
year = {2026}
}