MUStReason:诊断性视频语言模型中多模态讽刺检测的基准
机器学习
2025-10-29 v1 计算与语言
摘要
讽刺是一种特定类型的讽刺,涉及辨别言语内容与所指意义之间的关系。检测讽刺不仅依赖于言语的字面内容,还依赖于说话者的语调、面部表情和对话情境等非语言线索。然而,当前的多模态模型在讽刺检测等复杂任务上表现不佳,这类任务需要在多个模态中识别相关线索,并进行实质性推理以推断说话者的意图。为探索 VideoLMs 中的这些局限性,我们引入 MUStReason,一个包含特定模态相关线索和揭示讽刺意图的推理步骤注释的诊断性基准。除了对 VideoLMs 的讽刺分类性能进行基准测试外,使用 MUStReason 我们定性和定量评估生成的推理过程,通过将问题离散为感知与推理两个部分,我们提出 PragCoT 框架,引导 VideoLMs 关注隐含意图而非字面意义,这是检测讽刺的核心属性。
引用
@article{arxiv.2510.23727,
title = {MUStReason: A Benchmark for Diagnosing Pragmatic Reasoning in Video-LMs for Multimodal Sarcasm Detection},
author = {Anisha Saha and Varsha Suresh and Timothy Hospedales and Vera Demberg},
journal= {arXiv preprint arXiv:2510.23727},
year = {2025}
}