基于转录语音的说话人归属文体计量分析
计算与语言
2025-12-19 v3
摘要
法医科学家经常需要在赎金电话、秘密录音、疑似自杀遗书或匿名在线通信等案件中识别未知说话人或作者。语音领域的说话人识别通常考察声音的语音或声学特性,这些方法在某些条件下可以准确且鲁棒。然而,如果说话人伪装了声音或使用了文本转语音软件,声学特性可能不再可靠,只剩下其语言内容可供分析。作者归属方法传统上使用句法、语义和相关语言信息来识别书面文本的作者(作者归属)。在本文中,我们将一种基于内容的作者归属方法应用于转录为文本的语音,利用说话人所说的内容将语音归属到个人(说话人归属)。我们提出了一种文体计量方法 StyloSpeaker,它结合了文体计量文献中关于作者归属的字符、词、标记、句子和风格特征,来评估两个转录文本是否由同一说话人产生。我们在两种转录格式上进行评估:一种近似于带有大小写和标点符号的规范性书面文本,另一种是去除这些惯例的归一化风格。转录文本的对话主题也在不同程度上受到控制。我们发现,在归一化转录文本上通常具有更高的归属性能,但在最强的主题控制条件下,整体性能最高。最后,我们将这个更具可解释性的文体计量模型与相同数据上的黑箱神经网络方法进行了比较,并研究了哪些文体特征最能区分说话人。
引用
@article{arxiv.2512.13667,
title = {A stylometric analysis of speaker attribution from speech transcripts},
author = {Cristina Aggazzotti and Elizabeth Allyn Smith},
journal= {arXiv preprint arXiv:2512.13667},
year = {2025}
}
备注
v3: added StyloSpeaker github link; v2: added acknowledgments