中文

AnswerCarefully:一个用于提升日语 LLM 输出安全性的数据集

计算与语言 2025-06-04 v1

摘要

本文提出了 AnswerCarefully,一个用于促进日语 LLM 输出安全性和适当性的数据集。该数据集包含 1,800 对问题和参考答案,其中问题在回答时需要特别注意。它涵盖了先前英语数据集中确立的广泛风险类别,但数据样本是原创的,因为它们是手动创建以反映日本 LLM 使用的社会文化背景。我们表明,使用该数据集进行指令微调日语 LLM 可提高输出安全性,同时不损害一般回答的实用性。我们还报告了使用该数据集作为基准对 12 个日语 LLM 进行安全评估的结果。最后,我们描述了数据集的最新更新,提供了问题的英文翻译和标注,旨在促进在不同语言和地区推导类似数据集。

关键词

引用

@article{arxiv.2506.02372,
  title  = {AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output},
  author = {Hisami Suzuki and Satoru Katsumata and Takashi Kodama and Tetsuro Takahashi and Kouta Nakayama and Satoshi Sekine},
  journal= {arXiv preprint arXiv:2506.02372},
  year   = {2025}
}