从文本到声音:面向广播故事音效检索的初步研究
信息检索
2019-08-22 v1 计算与语言
声音
音频与语音处理
摘要
音效在制作高质量广播故事中起着至关重要的作用,但添加音效需要巨大的劳动力成本。本文以基于检索的模型自动为广播故事添加音效为研究问题。然而,直接实现基于标签的检索模型会因故事内容的歧义性而导致高误报率。为解决该问题,我们引入了一种与语义推断模型混合的基于检索的框架,有助于获得鲁棒的检索结果。我们的模型依赖于从候选触发点的上下文中提取的精细设计特征。我们通过众包收集了两个故事配音数据集,以分析添加音效的设置并训练和测试所提方法。我们进一步讨论了各特征的重要性,并引入了若干启发式规则以在精确率与召回率之间权衡。结合文本转语音技术,我们的结果揭示了一条制作高质量广播故事的有前景的自动化流水线。
引用
@article{arxiv.1908.07590,
title = {From Text to Sound: A Preliminary Study on Retrieving Sound Effects to Radio Stories},
author = {Songwei Ge and Curtis Xuan and Ruihua Song and Chao Zou and Wei Liu and Jin Zhou},
journal= {arXiv preprint arXiv:1908.07590},
year = {2019}
}
备注
In the Proceedings of the 42nd International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2019)