中文

针对非法活动的 LLM 安全评估问答数据集研究

计算与语言 2026-05-29 v1

摘要

本文讨论了用于 LLM 安全评估的问答数据集,聚焦于非法活动。具体而言,基于对 AnswerCarefully 的手动分析,我们介绍了若干额外信息、创建问答示例的方法以及用于评估 LLM 生成响应的评估标准。本研究结果旨在与“JAI-Trust”项目共享。

关键词

引用

@article{arxiv.2605.29340,
  title  = {A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities},
  author = {Kenji Imamura and Masao Ideuchi and Atsushi Fujita},
  journal= {arXiv preprint arXiv:2605.29340},
  year   = {2026}
}

备注

10 pages, 1 figure