反馈取证:一个衡量 AI 个性的工具包
计算与语言
2025-10-01 v1 人工智能
摘要
构成一个“好”AI 模型的某些特质很难预先描述。例如,回复应该更礼貌还是更随意?这些特质有时被概括为模型性格或个性。由于缺乏明确的目标,基于自动验证的传统基准测试难以衡量这些特质。使用人类反馈的评估方法,如 Chatbot Arena,已成为一种流行的替代方案。这些方法通过将多个模型回复进行相对排名,隐式地推断出“更好”的个性及其他理想特质。近期模型发布中出现的问题凸显了这些现有不透明评估方法的局限性:一个主要模型因谄媚的个性问题被回滚,模型被观察到过度拟合此类基于反馈的排行榜。尽管存在这些已知问题,但用于显式评估模型个性的公共工具仍然有限。我们推出了 Feedback Forensics:一个开源工具包,用于追踪 AI 个性变化,包括那些由人类(或 AI)反馈所鼓励的变化,以及那些在基于此类反馈训练和评估的 AI 模型中所展现的变化。利用 AI 标注器,我们的工具包能够通过 Python API 和浏览器应用来研究个性。我们分两步展示了该工具包的实用性:(A)首先,我们分析了流行的人类反馈数据集(包括 Chatbot Arena、MultiPref 和 PRISM)中所鼓励的个性特质;(B)然后,使用我们的工具包分析流行模型在多大程度上展现了这些特质。我们发布了(1)Feedback Forensics 工具包,(2)一个追踪流行模型和反馈数据集中 AI 个性的 Web 应用,以及(3)底层的标注数据,地址为 https://github.com/rdnfn/feedback-forensics。
引用
@article{arxiv.2509.26305,
title = {Feedback Forensics: A Toolkit to Measure AI Personality},
author = {Arduin Findeis and Timo Kaufmann and Eyke Hüllermeier and Robert Mullins},
journal= {arXiv preprint arXiv:2509.26305},
year = {2025}
}