中文

MELT:利用 LLM 内嵌知识实现自动多模态情感数据标注

人工智能 2025-06-02 v1 声音 音频与语音处理

摘要

尽管语音情感识别(SER)在深度学习的推动下取得了显著进展,但数据标注仍是一大难题。人工标注不仅成本高昂,且容易出现不一致——标注者通常具有不同的偏好,且可能缺乏必要的上下文知识,从而导致标签多样且不准确。同时,大型语言模型(LLM)已成为文本数据标注的可扩展替代方案。然而,LLM 在无人工监督下进行语音情感数据标注的潜力尚未得到深入研究。为解决这些问题,我们应用 GPT-4o 对从情景喜剧《老友记》中收集的多模态数据集进行标注,仅使用文本线索作为输入。通过构建结构化文本提示,我们的方法利用了 GPT-4o 在训练期间积累的知识,展示了它可以在不直接访问多模态输入的情况下生成准确且与上下文相关的标注。因此,我们提出了 MELT,一个完全由 GPT-4o 标注的多模态情感数据集。我们通过对四个自监督学习(SSL)骨干网络进行微调并评估跨情感数据集的语音情感识别性能,证明了 MELT 的有效性。此外,我们的主观实验结果证明了 SER 性能的一致性提升。

关键词

引用

@article{arxiv.2505.24493,
  title  = {MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge},
  author = {Xin Jing and Jiadong Wang and Iosif Tsangko and Andreas Triantafyllopoulos and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2505.24493},
  year   = {2025}
}