基于覆盖增强的多模态对话代理的隐式动作控制
计算与语言
2026-04-14 v2 人工智能
机器学习
摘要
视觉语言模型日益被用于作为多模态对话代理(MCA)处理多样化的对话任务。最近,强化学习(RL)被广泛探索用于适应各种人类-人工智能交互场景。尽管显示出在泛化性能方面取得显著提升,但通过 RL 微调 MCA 仍面临处理极大文本 token 空间的挑战。为此,我们学习一个紧凑的隐式动作空间用于 RL 微调。具体而言,我们采用学习自观察的机制构建隐式动作空间,其中利用未来观察来估计当前隐式动作,以进一步用于重构未来观察。然而,缺乏成对的图像-文本数据会阻碍构建足够覆盖的编码器。因此,我们利用成对的图像-文本数据和仅文本数据来构建隐式动作空间,并使用跨模态投影器将文本嵌入转换为图像-文本嵌入。我们在成对的图像-文本数据上初始化跨模态投影器,并通过一种新颖的循环一致性损失在大量仅文本数据上进一步训练,以增强其鲁棒性。我们表明,基于隐式动作的方法在两种对话任务上优于具有竞争力的基线,无论使用哪种 RL 算法。
引用
@article{arxiv.2601.07516,
title = {Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions},
author = {Yongqi Li and Hao Lang and Tieyun Qian and Yongbin Li},
journal= {arXiv preprint arXiv:2601.07516},
year = {2026}
}
备注
Accepted to ACL 2026 (Main), camera-ready version