LifeTox:揭示生活建议中的隐性毒性
计算与语言
2024-03-20 v2
摘要
随着大语言模型日益融入日常生活,在多样情境中检测隐性毒性至关重要。为此,我们引入LifeTox,一个为识别广泛寻求建议情境中的隐性毒性而设计的数据集。与现有安全数据集不同,LifeTox通过开放式问题由个人经历衍生出多样情境。实验表明,在LifeTox上微调的RoBERTa在毒性分类任务中匹配或超越大语言模型的零样本表现。这些结果凸显了LifeTox在应对隐性毒性固有复杂挑战上的有效性。我们开源了该数据集\footnote{\url{https://huggingface.co/datasets/mbkim/LifeTox}}以及LifeTox审核模型系列:350M、7B和13B。
引用
@article{arxiv.2311.09585,
title = {LifeTox: Unveiling Implicit Toxicity in Life Advice},
author = {Minbeom Kim and Jahyun Koo and Hwanhee Lee and Joonsuk Park and Hwaran Lee and Kyomin Jung},
journal= {arXiv preprint arXiv:2311.09585},
year = {2024}
}
备注
11 pages, 5 figures, NAACL 2024