芬兰情感语料库注释样本选择中的情感矿工技术 investigation
计算与语言
2025-05-26 v1 机器学习
摘要
情感语音研究需要合适的数据,因为情感表达和感知在不同语言之间存在差异。迄今为止,尚无针对自然芬兰语情感表达的语料库,现有数据要么为演示性的,要么来自特定的交际环境。本文提出首个此类语料库,通过为12,000个语音标记情感唤起性和价值,抽样自三个大型芬兰语语料库。为确保情感表达的多样性,采用结合声学特征、跨语言语音情感和文本情感特征的情感矿工方法进行抽样选择。我们将其与随机抽样进行比较,评估注释多样性,并进行事后分析以识别可最大化多样性的抽样选择。作为结果,该工作引入了自发的芬兰语情感语料库,并为其他语言或领域的情感语料库创建提供了抽样策略。
引用
@article{arxiv.2505.17833,
title = {Investigating Affect Mining Techniques for Annotation Sample Selection in the Creation of Finnish Affective Speech Corpus},
author = {Kalle Lahtinen and Einari Vaaras and Liisa Mustanoja and Okko Räsänen},
journal= {arXiv preprint arXiv:2505.17833},
year = {2025}
}
备注
Accepted for publication at Interspeech 2025, Rotterdam, The Netherlands