多语言 KokoroChat:用于创建多语言咨询对话数据集的多 LLM 集成翻译方法
计算与语言
2026-04-07 v2
摘要
为解决高质量、公开可获取咨询对话数据集严重不足的问题,我们通过将日语大型手动编写的咨询语料库KokoroChat翻译成英文和中文,创建了多语言 KokoroChat。在此过程中,关键挑战在于最佳翻译模型会因输入而异,任何单个模型都无法始终保证最高质量。在咨询等敏感领域,翻译保真度至关重要,依赖单一大语言模型因此不够。在本研究中,我们开发并应用了一种新颖的多 LLM 集成方法。我们的ethods首先从多个独立 LLM 生成多样化的假设,然后由单个 LLM 基于分析所有所呈现假设的优势与劣势,生成高质量翻译。通过人类偏好研究严格验证了"多语言 KokoroChat"的质量。这些评估确认,我们的集成方法产生的翻译被优先于任何单个最先进 LLM。这种强烈的偏好确认了我们方法输出的优越质量。多语言 KokoroChat 已在 https://github.com/UEC-InabaLab/MultilingualKokoroChat 上提供。
引用
@article{arxiv.2603.22913,
title = {Multilingual KokoroChat: A Multi-LLM Ensemble Translation Method for Creating a Multilingual Counseling Dialogue Dataset},
author = {Ryoma Suzuki and Zhiyang Qi and Michimasa Inaba},
journal= {arXiv preprint arXiv:2603.22913},
year = {2026}
}
备注
12 pages, 8 figures, Accepted to LREC 2026