中文

DITTO:面向ASR口音自适应的数据高效且公平的定向子集选择

音频与语音处理 2024-12-18 v4 声音

摘要

最先进的自动语音识别(ASR)系统已知在不同语音口音上表现出差异化的性能。为提升在特定目标口音上的表现,一种常用方案是使用口音特定的标注语音微调ASR模型。然而,获取大量特定目标口音的标注语音颇具挑战。选取最能代表目标口音、信息量丰富的语音样本子集,对于有效的ASR微调至关重要。为解决该问题,我们提出DITTO(Data-efficient and faIr Targeted subseT selectiOn,数据高效且公平的定向子集选择),其使用子模互信息(SMI)函数作为采集函数,在固定预算内寻找最匹配目标口音的信息量最大语句集。DITTO的一个重要特性是支持多口音的公平定向,即当ASR模型需在多种口音上均表现良好时,它能自动从多个口音中选取代表性数据点。我们表明,在IndicTTS与L2数据集上,DITTO的标注效率是其他语音选择方法的3-5倍。

关键词

引用

@article{arxiv.2110.04908,
  title  = {DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation},
  author = {Suraj Kothawade and Anmol Mekala and Chandra Sekhara D and Mayank Kothyari and Rishabh Iyer and Ganesh Ramakrishnan and Preethi Jyothi},
  journal= {arXiv preprint arXiv:2110.04908},
  year   = {2024}
}

备注

ACL 2023