聊天机器人可信人类评估的挑战
人机交互
2024-12-06 v1
摘要
像 Chatbot Arena 这样的开放社区驱动平台通过收集来自网站访客的偏好数据,已因被认为是 LLM 性能最可信的公开基准之一而获得良好声誉。尽管如此,实施有效的 guardrails 来收集高质量的人类注释仍颇具挑战性。本文我们表明,三个来自差恶意注释来源(包括不恰当激励导致的漠不关心访客和寻求放大特定模型排名的对手行为者)可损害开放排行榜排名的可靠性。特别是,我们展示仅 10% 来自漠不关心或对手注释者的差质量投票,即可使模型排名在排行榜上上升至 5 名。最后,我们讨论了确保高质量人类注释的开放性挑战。
引用
@article{arxiv.2412.04363,
title = {Challenges in Trustworthy Human Evaluation of Chatbots},
author = {Wenting Zhao and Alexander M. Rush and Tanya Goyal},
journal= {arXiv preprint arXiv:2412.04363},
year = {2024}
}