MMPersuade:多模态说服的数据集与评估框架
计算与语言
2025-10-28 v1
摘要
随着大型视觉语言模型(LVLMs)在购物、健康和新闻等领域的广泛应用,这些模型正暴露于持续的说服性内容之中。一个关键问题是这些模型作为说服对象的行为如何——它们如何以及为何会被说服性输入所影响。理解这些模型对说服的易感性以及不同说服策略的有效性至关重要,因为过于易受说服的模型可能会采取误导性信念,覆盖用户偏好,或在暴露于操纵性信息时生成不道德或不安全的输出。我们引入MMPersuade,一个系统性地研究LVLMs中多模态说服动态的统一框架。MMPersuade贡献了:(i)一个综合的多模态数据集,将图像和视频与商业、主观和行为,以及对抗性情境下的既定说服原则相配对;(ii)一个评估框架,通过第三方一致性评分和对话历史自估标记概率来量化说服效果和模型易感性。我们对六大前沿LVLMs作为说服对象的研究,得出三个关键发现:(i)相较于文本alone,多模态输入在说服效果——以及模型易感性——方面显著提升,尤其在误导性情境中表现突出;(ii)声明的既有偏好会降低易感性,但多模态信息保持其说服优势;(iii)不同策略在不同情境下的有效性各不相同,在商业和主观情境中, reciprocity( reciprocity )最为有效;在对抗性情境中,credibility(可信度)和logic(逻辑)更为有效。通过联合分析说服效果和易感性,MMPersuade为开发在面对说服性多模态内容时具备鲁棒性、符合偏好且符合伦理的模型提供了原则性基础。
引用
@article{arxiv.2510.22768,
title = {MMPersuade: A Dataset and Evaluation Framework for Multimodal Persuasion},
author = {Haoyi Qiu and Yilun Zhou and Pranav Narayanan Venkit and Kung-Hsiang Huang and Jiaxin Zhang and Nanyun Peng and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2510.22768},
year = {2025}
}