IndoPref:面向印尼语的多域对齐偏好数据集
计算与语言
2025-11-13 v2 人工智能
摘要
超过20000万人口使用印尼语,但该语言在大型语言模型(LLM)的偏好基准研究中仍严重不足。大多数多语言数据集源自英文翻译,往往导致内容缺乏文化和语言真实性。为此,我们引入IndoPref——第一个完全由人类撰写且覆盖多领域的印尼语偏好数据集,用于评估大语言模型生成文本的自然性与质量。数据集包含522个提示,产生4099条来自对比测试中5个指令调优大语言模型的人类标注偏好。所有标注均为印尼语原生编写,且通过Krippendorff's alpha值衡量。我们的基准涵盖10个多样化类别,使实践者能够识别大语言模型在细粒度方面的优势与不足。
引用
@article{arxiv.2507.22159,
title = {IndoPref: A Multi-Domain Pairwise Preference Dataset for Indonesian},
author = {Vanessa Rebecca Wiyono and David Anugraha and Ayu Purwarianti and Genta Indra Winata},
journal= {arXiv preprint arXiv:2507.22159},
year = {2025}
}
备注
Accepted by IJCNLP-AACL 2025