中文

大型语言模型的测试与评估:正确性、无毒性与公平性

计算与语言 2024-09-04 v1 人工智能 软件工程

摘要

大型语言模型(LLMs),如 ChatGPT,凭借其非凡的对话技能和智能,在过去几年中迅速渗透到人们的工作和日常生活中。ChatGPT 已成为人类历史上用户数量增长最快的软件,并成为下一代人工智能应用的重要基础模型。然而,LLMs 的生成内容并非完全可靠,经常产生包含事实错误、偏见和毒性的内容。鉴于其庞大的用户群体和广泛的应用场景,这些不可靠的响应可能导致许多严重的负面影响。本论文介绍了博士研究期间在语言模型可靠性领域的探索性工作,从软件测试和自然语言处理两个视角,重点关注 LLMs 的正确性、无毒性和公平性。首先,为了衡量 LLMs 的正确性,我们引入了两个测试框架 FactChecker 和 LogicAsker,分别用于评估事实知识和逻辑推理的准确性。其次,针对 LLMs 的无毒性,我们引入了两项用于红队测试 LLMs 的工作。第三,为了评估 LLMs 的公平性,我们引入了两个评估框架 BiasAsker 和 XCulturalBench,分别用于衡量 LLMs 的社会偏见和文化偏见。

引用

@article{arxiv.2409.00551,
  title  = {Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness},
  author = {Wenxuan Wang},
  journal= {arXiv preprint arXiv:2409.00551},
  year   = {2024}
}

备注

PhD Thesis