中文

ViToSA:基于音频的越南语语音话语毒性跨度检测

计算与语言 2025-06-03 v1

摘要

在线平台上的有毒语音日益受到关注,影响着用户体验和在线安全。尽管基于文本的毒性检测已被广泛研究,但基于音频的方法仍待探索,尤其是对于越南语等低资源语言。本文介绍了 ViToSA(越南语毒性跨度音频),这是首个用于越南语语音毒性跨度检测的数据集,包含 11,000 个音频样本(25 小时)并带有准确的人工标注转录文本。我们提出了一种结合 ASR 和毒性跨度检测的流水线,用于细粒度地识别有毒内容。我们的实验表明,在 ViToSA 上微调 ASR 模型可显著降低转录有毒语音时的 WER,而基于文本的毒性跨度检测 (TSD) 模型优于现有基线。这些发现为基于音频的越南语毒性跨度检测确立了新基准,为未来语音内容审核研究铺平了道路。

关键词

引用

@article{arxiv.2506.00636,
  title  = {ViToSA: Audio-Based Toxic Spans Detection on Vietnamese Speech Utterances},
  author = {Huy Ba Do and Vy Le-Phuong Huynh and Luan Thanh Nguyen},
  journal= {arXiv preprint arXiv:2506.00636},
  year   = {2025}
}

备注

Accepted for presentation at INTERSPEECH 2025