中文

J-CHAT:日本大型口语对话语料库用于口语对话语言建模

计算与语言 2026-04-03 v2 声音 音频与语音处理

摘要

口语对话是人类与AI交互的关键,提供了文本之外的表达能力。开发有效的口语对话系统(SDS)需要大规模、高质量且多样化的口语对话语料库。然而,现有数据集在规模、自然性或语言连贯性方面往往有限。为此,我们引入J-CHAT,这是一个76,000小时开源的日语口语对话语料库。J-CHAT采用自动化、语言无关的方法构建,确保语音干净、多样且具有自然的自发性。该语料库基于YouTube和播客数据,通过广泛的过滤和降噪来提升质量。实验结果表明,在J-CHAT上训练的生成式口语对话语言模型有效支持了SDS的开发。我们预计,J-CHAT将为训练先进的对话模型提供稳健的基础,从而推动人机对话研究及其应用的进展。

关键词

引用

@article{arxiv.2407.15828,
  title  = {J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling},
  author = {Wataru Nakata and Kentaro Seki and Hitomi Yanaka and Yuki Saito and Shinnosuke Takamichi and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2407.15828},
  year   = {2026}
}

备注

8 pages, 3 figures