单模语言智能体能否为调谐多模态视觉语言模型提供偏好?
计算与语言
2026-01-13 v1
摘要
为探索为现有大语言模型添加多模态能力的更可扩展路径,本文关注一个根本问题:单模语言模型能否仅凭文本推理,关于自身信息需求进行推理并为优化多模态模型提供有效反馈?为此,我们提出一种方法,使语言智能体能够为视觉语言模型(VLM)提供反馈,以适应智能体偏好进行文本生成。我们的实验结果确认了这一假设,表明LLM偏好反馈显著提升了VLM描述。使用我们的方法发现,VLM能够生成多模态场景描述以帮助LLM更好地理解多模态语境,实现最高可达13个绝对百分点的准确率提升。此外,人类研究验证了我们AI驱动的反馈,显示LLM选择与人类判断之间的偏好一致率为64.6%。广泛的实验提供了关于方法如何及为何有效以及其局限性的见解。
引用
@article{arxiv.2601.06424,
title = {Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?},
author = {Sazia Tabasum Mim and Jack Morris and Manish Dhakal and Yanming Xiu and Maria Gorlatova and Yi Ding},
journal= {arXiv preprint arXiv:2601.06424},
year = {2026}
}
备注
Accepted to IJCNLP-AACL 2025 Findings