LOTUSDIS:用于鲁棒对话式 ASR 的泰语远场会议语料库
计算与语言
2025-09-24 v1 声音
摘要
我们提出了 LOTUSDIS,一个公开可用的泰语会议语料库,旨在推动远场对话式 ASR 的发展。该数据集包含 114 小时的自发、无脚本对话,是在由三名参与者参与的 15-20 分钟会议中收集的,其中频繁且自然地出现语音重叠。语音由跨越六种麦克风类型、距离从 0.12 米到 10 米不等的九个独立单通道设备同步录制,在不依赖麦克风阵列的情况下保留了混响、噪声和设备声染色的真实影响。我们提供了标准的训练、开发、测试集划分,并发布了一个可复现的基线系统。我们在零样本和微调条件下对几种 Whisper 变体进行了基准测试。现成模型在性能上随距离显著下降,证实了预训练数据与泰语远场语音之间存在不匹配。在 LOTUSDIS 上进行微调显著提高了鲁棒性:泰语 Whisper 基线将整体词错率从 64.3 降至 38.3,远场词错率从 81.6 降至 49.5,在最远麦克风上取得了尤为显著的提升。这些结果强调了距离多样性训练数据对鲁棒 ASR 的重要性。该语料库在 CC-BY-SA 4.0 许可下提供。我们还发布了训练和评估脚本作为基线系统,以促进该领域的可复现研究。
引用
@article{arxiv.2509.18722,
title = {LOTUSDIS: A Thai far-field meeting corpus for robust conversational ASR},
author = {Pattara Tipaksorn and Sumonmas Thatphithakkul and Vataya Chunwijitra and Kwanchiva Thangthai},
journal= {arXiv preprint arXiv:2509.18722},
year = {2025}
}