TrustGPT:面向可信与负责任大型语言模型的基准
计算与语言
2023-06-21 v1 人工智能
摘要
诸如 ChatGPT 等大型语言模型(LLM)因其令人瞩目的自然语言处理能力而备受关注。在使用这些模型时,优先考虑以人为中心的原则至关重要。保障 LLM 的伦理与道德合规性具有首要意义。然而,最新的 LLM 在个别伦理问题上尚未得到充分研究。因此,本研究旨在通过引入一个新基准——TrustGPT 来填补这些空白。TrustGPT 在三个关键领域对 LLM 进行了全面评估:毒性、偏见和价值对齐。首先,TrustGPT 利用源自社会规范的毒性提示模板检验语言模型中的毒性。其次,通过测量不同群体间可量化的毒性值,量化模型中的偏见程度。最后,TrustGPT 从主动价值对齐和被动价值对齐任务两方面评估对话生成模型的价值。通过实施 TrustGPT,本研究旨在加深对对话生成模型性能的理解,并促进更具伦理性和社会责任感的语言模型的发展。
引用
@article{arxiv.2306.11507,
title = {TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models},
author = {Yue Huang and Qihui Zhang and Philip S. Y and Lichao Sun},
journal= {arXiv preprint arXiv:2306.11507},
year = {2023}
}
备注
We are currently expanding this work and welcome collaborators!