书写文本检测提升 spoken 词检测
音频与语音处理
2024-07-08 v1 计算与语言
摘要
端到端 (E2E) 关键词搜索 (KWS) 方法在训练和索引复杂度方面相较于使用自动语音识别 (ASR) 输出的方案要简单得多。这种简化虽然简化了流程,但也带来了劣势,由于模块性的丧失。特别是,ASR 基于的 KWS 系统可从外部无配对文本中受益于语言模型,而当前的 E2E KWS 方案则缺乏此类机制。因此,本文提出一种多任务训练目标,允许在不复杂化索引和搜索的前提下将无配对文本整合到 E2E KWS 中。除了训练 E2E KWS 模型从口头文档中检索文本查询外,我们还联合训练其从被遮盖的书写文档中检索文本查询。我们通过实验表明,这种方法可有效利用无配对文本进行 KWS, 在各种语言上均实现了显著的搜索性能提升。我们进行分析表明,这些改进是通过提升无配对文本中单词的文档表示而实现的。最后,我们展示该方法可用于在配对数据稀缺或不存在的场景中的领域适应。
引用
@article{arxiv.2407.04601,
title = {Written Term Detection Improves Spoken Term Detection},
author = {Bolaji Yusuf and Murat Saraçlar},
journal= {arXiv preprint arXiv:2407.04601},
year = {2024}
}
备注
IEEE/ACM Transactions on Audio, Speech and Language Processing (TASLP), 2024. Code at https://github.com/bolajiy/golden-retriever