中文

iMiGUE-Speech:用于情感分析的自发语音数据集

音频与语音处理 2026-02-26 v1 计算与语言

摘要

本工作提出iMiGUE-Speech,是iMiGUE 数据集的一个扩展版本,提供了一个用于研究情感和情感状态的自发情感语料库。新版本专注于语音,丰富了原始数据集的附加元数据,包括语音转录、说话人角色在访谈者和被访者之间的分离,以及单词级的 forced 对齐。与现有情感语音数据集不同,后者依赖演示或实验诱导的情感,iMiGUE-Speech 捕获自然从真实比赛结果中产生的自发情感。为展示数据集的实用性并建立初始基准,我们引入两个评估任务进行比较评估:语音情感识别和基于转录的情感分析。这两个任务利用最先进的 pre-trained 表示来评估数据集从声学和语言模态中捕获自发情感状态的能力。iMiGUE-Speech 还可以与原始iMiGUE 数据集中同步的 micro-gesture 注释配对,形成一个独特的多模态资源,用于研究语音-手势情感动力学。该扩展数据集可在 https://github.com/CV-AC/imigue-speech 获取。

关键词

引用

@article{arxiv.2602.21464,
  title  = {iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis},
  author = {Sofoklis Kakouros and Fang Kang and Haoyu Chen},
  journal= {arXiv preprint arXiv:2602.21464},
  year   = {2026}
}

备注

Accepted to Speech Prosody 2026