S-VoCAL:用于推断文学中说话人声属性的数据集与评估框架
计算与语言
2026-03-03 v1
摘要
随着文本转语音(TTS)系统的最新进展,合成有声书阅读水平实现了空前的自然性。然而,合成朗读系统在模仿虚构人物、传递复杂情感或语调方面的能力仍存在显著差距。增强人物识别的可行方法之一是为书籍中每个虚构人物分配合理的语音。此步骤通常需要在书篇上下文中推断属性,如人物年龄、性别、来源或身体健康状况,这需要专门的数据集来评估提取系统的性能。我们提出S-VoCAL(Speaking Voice Character Attributes in Literature),首个专用于评估推断语音相关虚构人物属性的数据集与评估框架。S-VoCAL包含8个基于社会语音学研究的属性,以及从Project Gutenberg提取的952个人物-书籍配对。其评估框架针对每个属性的特殊性进行设计,包括基于最新大型语言模型嵌入的 novel 相似度度量。我们通过应用简单的检索增强生成(RAG)管道演示了S-VoCAL的适用性。结果表明,RAG管道可可靠地推断如年龄或性别等属性,但在其他属性如来源或身体健康方面仍感到困难。数据集和评估代码已发布于https://github.com/AbigailBerthe/S-VoCAL。
引用
@article{arxiv.2603.00958,
title = {S-VoCAL: A Dataset and Evaluation Framework for Inferring Speaking Voice Character Attributes in Literature},
author = {Abigail Berthe-Pardo and Gaspard Michel and Elena V. Epure and Christophe Cerisara},
journal= {arXiv preprint arXiv:2603.00958},
year = {2026}
}
备注
Accepted to LREC 2026