中文

Eagle:源自真实交互的伦理数据集

计算与语言 2024-02-23 v1

摘要

最近的研究表明,大型语言模型(LLMs)存在与社会偏见、缺乏道德推理以及生成冒犯性内容等相关的伦理问题。现有的用于解决这些伦理挑战的评估指标和方法使用的是由人工刻意创建的包含伦理问题的实例数据集。因此,这些数据无法反映用户在日常场景中使用 LLM 服务时实际提供的提示。这可能导致无法开发出能够应对现实世界应用中出现的伦理挑战的安全 LLM。在本文中,我们创建了 Eagle 数据集,该数据集提取自 ChatGPT 与用户之间的真实交互,展现了社会偏见、毒性和不道德问题。我们的实验表明,Eagle 捕捉到了现有用于评估和缓解此类伦理挑战的数据集所未涵盖的互补方面。我们的代码公开于 https://huggingface.co/datasets/MasahiroKaneko/eagle。

关键词

引用

@article{arxiv.2402.14258,
  title  = {Eagle: Ethical Dataset Given from Real Interactions},
  author = {Masahiro Kaneko and Danushka Bollegala and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2402.14258},
  year   = {2024}
}