我们能信任对 ChatGPT 的评估吗?
计算与语言
2024-08-23 v2 人工智能
机器学习
摘要
ChatGPT 作为首个大规模采用的大语言模型(LLM),已在众多自然语言任务中展现出卓越性能。尽管其实用性显而易见,但由于模型的封闭性以及通过人类反馈强化学习(RLHF)持续更新,在多样化问题域中评估 ChatGPT 的性能仍然具有挑战性。我们强调了 ChatGPT 评估中的数据污染问题,并以立场检测任务作为案例研究。我们讨论了在封闭且持续训练的模型时代,防止数据污染并确保公平模型评估所面临的挑战。
引用
@article{arxiv.2303.12767,
title = {Can we trust the evaluation on ChatGPT?},
author = {Rachith Aiyappa and Jisun An and Haewoon Kwak and Yong-Yeol Ahn},
journal= {arXiv preprint arXiv:2303.12767},
year = {2024}
}