Task-Lens:基于跨任务效用的印度低资源语言语音数据集轮廓
计算与语言
2026-03-02 v1 人工智能
声音
音频与语音处理
摘要
包容性语音技术日益增长的需求放大了对自然语言处理(NLP)研究的多语言数据集需求。然而,对现有任务特定资源在低资源语言中的了解不足阻碍了研究。这一挑战在语言多样性国家(如印度)尤为突出。对现有印度语音数据集进行跨任务轮廓化可缓解数据稀缺挑战。这涉及调查数据集在多个下游任务中的效用,而不仅仅是关注单个任务。以往的调查通常仅针对单个任务对数据集进行目录化,留下了全面的跨任务轮廓化作为开放机会。因此,我们提出了Task-Lens,一个跨任务调查,评估了50个印度语音数据集在9个下游语音任务中的准备就绪情况。首先,我们分析哪些数据集包含适合特定任务的元数据和属性。接下来,我们提出与任务对齐的增强措施,以释放数据集的下游潜能。最后,我们识别出当前资源中关键欠服务的任务和印度语言。我们的发现表明,许多印度语音数据集包含可支持多个下游任务的未开发元数据。通过揭示跨任务联系和差距,Task-Lens使研究人员能够探索现有数据集的更广泛适用性,并优先考虑为欠服务的任务和语言创建数据集。
引用
@article{arxiv.2602.23388,
title = {Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages},
author = {Swati Sharma and Divya V. Sharma and Anubha Gupta},
journal= {arXiv preprint arXiv:2602.23388},
year = {2026}
}
备注
Accepted at LREC 2026