评估多模态大语言模型在口语讽刺理解上的表现
计算与语言
2025-09-22 v1 多媒体
摘要
讽刺检测是自然语言理解中的一个挑战,因为讽刺意图常常依赖于跨模态的细微线索,涉及文本、语音和视觉信息。虽然先前工作主要关注文本或视觉-文本讽刺,但综合的音频-视觉-文本讽刺理解仍未得到充分探索。本文在零样本、few-shot和LoRA微调设置下,系统评估了大语言模型(LLM)和多模态大语言模型(MLLM)在英语(MUStARD++)和中文(MCSD 1.0)上的讽刺检测能力。除了直接进行分类,我们还探索了将模型用作特征编码器,通过协作门控融合模块整合其表示。实验结果显示,音频模型在单模态方面表现最强,而text-audio和audio-vision的组合优于单模态和三模态模型。此外,诸如Qwen-Omni等MLLM在零样本和微调方面表现出竞争力。我们的发现凸显了MLLM在跨语言、音频-视觉-文本讽刺理解方面的潜力。
引用
@article{arxiv.2509.15476,
title = {Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding},
author = {Zhu Li and Xiyuan Gao and Yuqing Zhang and Shekhar Nayak and Matt Coler},
journal= {arXiv preprint arXiv:2509.15476},
year = {2025}
}