ToxicTone:面向毒性与毒性语气的普通话音频数据集
音频与语音处理
2025-05-22 v1 计算与语言
声音
摘要
尽管在文本毒性语音检测方面已有大量研究,但处理口语普通话音频的工作仍存显著空白。缺乏能捕捉普通话独特韵律线索和文化特定表达的标注数据集,导致spoken toxicity研究不足。为此,我们介绍ToxicTone —— 目前规模最大的数据集,特点是详细标注区分了两种毒性形式(如脏话、欺凌)以及毒性来源(如愤怒、讽刺、轻蔑)。我们的数据来源于多样化的真实音频场景,按13个主题类别组织,镜像了真实的交际情境。我们还提出了一种多模态检测框架,集成声学特征、语言特征和情感特征,采用最新语音和情感编码器。大量实验表明,我们的方法优于仅基于文本的方法和基线模型,凸显了语音特定线索在揭示隐性毒性表达中的关键作用。
引用
@article{arxiv.2505.15773,
title = {ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality},
author = {Yu-Xiang Luo and Yi-Cheng Lin and Ming-To Chuang and Jia-Hung Chen and I-Ning Tsai and Pei Xing Kiew and Yueh-Hsuan Huang and Chien-Feng Liu and Yu-Chen Chen and Bo-Han Feng and Wenze Ren and Hung-yi Lee},
journal= {arXiv preprint arXiv:2505.15773},
year = {2025}
}
备注
Accepted by INTERSPEECH 2025. 5 pages