以最少人力快速开发高质量大语言模型指令数据与评估基准:以日语为例
计算与语言
2024-03-07 v1 人工智能
摘要
为大语言模型创建指令数据和评估基准通常涉及大量的人工标注。当为非英语语言(如日语)快速开发此类资源时,这一问题尤为突出。我们没有遵循将现有英语资源直接翻译成日语的流行做法(例如 Japanese-Alpaca),而是提出了一种基于 GPT-4 的高效自指令(self-instruct)方法。我们首先将少量英语指令翻译成日语并进行后期编辑,以获得母语级别的质量。然后,GPT-4 利用这些作为示例自动生成日语指令数据。我们还构建了一个包含 8 个类别共 80 个问题的评估基准,利用 GPT-4 在没有人工参考的情况下自动评估大语言模型的响应质量。实证结果表明,在我们基于 GPT-4 自指令数据上微调的模型在所有三个基础预训练模型上均显著优于 Japanese-Alpaca。我们的 GPT-4 自指令数据使得 LLaMA 13B 模型以 54.37% 的胜率击败了 GPT-3.5 (Davinci-003)。人工评估显示 GPT-4 的评估与人类偏好具有一致性。我们的高质量指令数据和评估基准已在此发布。
引用
@article{arxiv.2403.03690,
title = {Rapidly Developing High-quality Instruction Data and Evaluation Benchmark for Large Language Models with Minimal Human Effort: A Case Study on Japanese},
author = {Yikun Sun and Zhen Wan and Nobuhiro Ueda and Sakiko Yahata and Fei Cheng and Chenhui Chu and Sadao Kurohashi},
journal= {arXiv preprint arXiv:2403.03690},
year = {2024}
}
备注
COLING 2024. Our code are available here: \href{https://github.com/hitoshizuku7/awesome-Ja-self-instruct}{self-instruct data} and \href{https://github.com/ku-nlp/ja-vicuna-qa-benchmark}{evaluation benchmark}