自动语音转录对说话人归属的影响
计算与语言
2026-01-27 v3 机器学习
摘要
从语音转录中进行说话人归属是指根据其语言使用的模式从说话人语音的转录中识别说话人的任务。当音频不可用(例如被删除)或不可靠(例如匿名语音)时,这一任务尤为有用。该领域的 prior research 主要 focus 于使用由人工标注者生成的转录来归属说话人的可行性。然而,在实际场景中,通常只有来自自动语音识别(ASR)系统生成的更 errorful 的转录。本文我们进行了据称是首个全面研究自动转录对说话人归属性能影响的研究。特别是我们研究在转录错误面前,说话人归属性能会降低到什么程度,以及 ASR 系统的属性如何影响归属。我们发现归属对 word-level 转录错误 surprisingly 具有鲁棒性,并且恢复真实转录的目标与归属性能 minimally 相关。总体而言,我们的发现表明,基于 ASR 生成的更 errorful 的转录进行说话人归属的效果,可能比基于人工转录数据的归属更好,因为 ASR 转录错误可能捕获揭示说话人身份的说话人特定特征。
引用
@article{arxiv.2507.08660,
title = {The Impact of Automatic Speech Transcription on Speaker Attribution},
author = {Cristina Aggazzotti and Matthew Wiesner and Elizabeth Allyn Smith and Nicholas Andrews},
journal= {arXiv preprint arXiv:2507.08660},
year = {2026}
}
备注
latest version added TACL journal DOI to metadata and a missing citation