FFT:面向LLM事实性、公平性与毒性的无害性评估与分析基准
计算与语言
2024-12-24 v2 密码学与安全
摘要
生成式人工智能的普及加剧了对AI生成文本潜在危害的担忧,主要源于事实错误、不公平及有毒内容。以往研究者已投入大量精力评估生成式语言模型的危害性。然而,现有基准在大语言模型(LLMs)时代面临困境,因其更强的语言生成与指令遵循能力以及更广泛的应用。本文提出FFT,一个包含2116个精心设计的实例的新基准,用于从事实性、公平性和毒性三方面评估LLM无害性。为探究LLM的潜在危害,我们评估了9个涵盖不同参数规模、训练阶段与开发者的代表性LLM。实验表明LLM的无害性仍不尽如人意,且大量分析得出若干可启发未来无害LLM研究的洞见。
引用
@article{arxiv.2311.18580,
title = {FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity},
author = {Shiyao Cui and Zhenyu Zhang and Yilong Chen and Wenyuan Zhang and Tianyun Liu and Siqi Wang and Tingwen Liu},
journal= {arXiv preprint arXiv:2311.18580},
year = {2024}
}
备注
Accepted by KDD workshop on Evaluation and Trustworthiness of Generative AI Models