SafeText:探索语言模型物理安全性的基准
计算与语言
2022-10-19 v1 人工智能
摘要
理解何种文本构成安全文本是自然语言处理中的重要问题,且常能阻止被视为有害和不安全的模型部署。一类甚少被研究的此类安全性是常识物理安全性,即文本并非显式暴力,而需要额外常识知识才能理解其会导致身体伤害。我们创建了首个基准数据集 SafeText,包含具有成对安全与物理不安全建议的真实生活场景。我们利用 SafeText 对为文本生成与常识推理任务设计的各类模型中的常识物理安全性进行实证研究。我们发现最先进的大语言模型易生成不安全文本,且难以拒斥不安全建议。因此,我们主张在模型发布前开展进一步的安全性研究并评估其常识物理安全性。
引用
@article{arxiv.2210.10045,
title = {SafeText: A Benchmark for Exploring Physical Safety in Language Models},
author = {Sharon Levy and Emily Allaway and Melanie Subbiah and Lydia Chilton and Desmond Patton and Kathleen McKeown and William Yang Wang},
journal= {arXiv preprint arXiv:2210.10045},
year = {2022}
}
备注
Accepted to EMNLP 2022