大语言模型驱动的多模态意见表达识别
计算与语言
2024-09-25 v2 人工智能
声音
音频与语音处理
摘要
意见表达识别 (OEI) 是自然语言处理中的关键任务,适用于从语音助手到抑郁诊断等各种应用。本研究将 OEI 扩展至多模态输入,凸显听觉线索在超越文本能力的情感细微差别方面的重要性。我们提出了一种新颖的多模态 OEI (MOEI) 任务,将文本和语音整合以模拟真实场景。利用 CMU MOSEI 和 IEMOCAP 数据集,我们构建了 CI-MOEI 数据集。此外,应用语音合成技术 (TTS) 可获得 MPQA 数据集的 CIM-OEI 数据集。我们设计了一种用于充分发挥大语言模型 (LLM) 生成能力的 OEI 任务模板。进一步地,我们提出了一种 LLM驱动的方法 STOEI,将语音和文本两种模态结合用于识别意见表达。我们的实验表明,MOEI 在性能上显著提升,而我们的方法相较于现有方法提升了 9.20%,并取得最佳结果。
引用
@article{arxiv.2406.18088,
title = {LLM-Driven Multimodal Opinion Expression Identification},
author = {Bonian Jia and Huiyao Chen and Yueheng Sun and Meishan Zhang and Min Zhang},
journal= {arXiv preprint arXiv:2406.18088},
year = {2024}
}
备注
5 pages, 3 Figures, Accept by Interspeech 2024