中文

CHARM:基于LLM的多模态讽刺检测的电荷校准与声学救援

声音 2026-07-13 v1

摘要

讽刺检测,即识别字面意义与预期意义之间的差异,是情感计算中的一项基本任务。然而,零样本指令微调的大型语言模型(LLM)在整个能力谱系上系统性地过度预测正面(讽刺)类别,而人类所依赖的韵律线索仍未得到充分利用,并且在不同语言间的迁移效果不均。我们提出了CHARM(用于多模态讽刺检测的电荷校准与声学救援),一个无需训练的框架,它结合了两个模块。双向电荷校准(BiCAL)沿着对称的带电提示轴引导LLM得出相反的讽刺和字面判断;由此产生的方向性偏差在构造上相互抵消,简单的聚合即可恢复无偏的语用信号。声学后期融合救援(ALFR)随后通过浅层分类器将校准后的投票与韵律描述符和LLM生成的听觉感知探针融合,主动降低饱和文本投票的权重,转而支持声学证据。在无需微调任何主干网络的情况下,BiCAL在MUStARD上达到了最高的零样本文本-only Macro-F1分数0.787,而ALFR在CMMA上将弱主干网络的Macro-F1提升了高达+0.382。Stouffer元分析确认了在MUStARD和CMMA上的统计显著性(分别为Z = 13.89和Z = 34.64;p < 10^-43)。我们的分析进一步揭示了一种跨文化的韵律解耦:低级声学特征无法跨语言迁移,而高级感知抽象则保持稳健。这些组件共同构成了一个可解释的、跨语言的多模态检测器。

关键词

引用

@article{arxiv.2607.11102,
  title  = {CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection},
  author = {Qiyang Sun and Yi Chang and Yupei Li and Xi Shao and Zixing Zhang and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2607.11102},
  year   = {2026}
}

备注

under review