中文

WangchanThaiInstruct:一个用于泰语文化感知、多任务和多领域评估的指令遵循数据集

计算与语言 2025-09-22 v2

摘要

大型语言模型在英语指令遵循方面表现出色,但在泰语等低资源语言中的性能仍未得到充分探索。现有基准测试通常依赖翻译,缺少实际应用所需的文化和领域特定细微差别。我们提出了 WangchanThaiInstruct,这是一个人工编写的泰语数据集,用于评估和指令微调,涵盖四个专业领域和七种任务类型。该数据集通过一个由标注员、领域专家和 AI 研究人员参与的多阶段质量控制流程创建,支持两项研究:(1)一项零样本评估,揭示了在文化和专业特定任务上的性能差距;(2)一项指令微调研究,通过消融实验分离了母语监督的效果。在 WangchanThaiInstruct 上微调的模型在领域内和领域外基准测试中均优于使用翻译数据的模型。这些发现强调了在低资源、语言多样化的环境中,需要基于文化和专业背景的指令数据来改善大型语言模型的对齐。

关键词

引用

@article{arxiv.2508.15239,
  title  = {WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai},
  author = {Peerat Limkonchotiwat and Pume Tuchinda and Lalita Lowphansirikul and Surapon Nonesung and Panuthep Tasawong and Alham Fikri Aji and Can Udomcharoenchaikit and Sarana Nutanong},
  journal= {arXiv preprint arXiv:2508.15239},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Main). Model and Dataset: https://huggingface.co/collections/airesearch/wangchan-thai-instruction-6835722a30b98e01598984fd