中文

面向大语言模型伦理微调的韩语有毒指令数据集自动构建

计算与语言 2023-12-01 v1

摘要

注意:本文可能包含令人不适或困扰的材料。大语言模型(LLMs)的出现亟需开发能够缓解不道德语言生成并妥善应对有毒用户查询的训练方法。鉴于人力相关挑战与数据稀缺性,我们提出了 KoTox,其包含 39K 个不道德指令-输出对。这一自动生成的有毒指令集合精炼了 LLM 的训练,并为提升 LLM 的伦理意识及应对各类有毒输入的能力建立了基础框架,从而促进自然语言处理(NLP)应用中更安全、负责任的互动。

关键词

引用

@article{arxiv.2311.18215,
  title  = {Automatic Construction of a Korean Toxic Instruction Dataset for Ethical Tuning of Large Language Models},
  author = {Sungjoo Byun and Dongjun Jang and Hyemi Jo and Hyopil Shin},
  journal= {arXiv preprint arXiv:2311.18215},
  year   = {2023}
}

备注

NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following