中文

我们能信任对 ChatGPT 的评估吗?

计算与语言 2024-08-23 v2 人工智能 机器学习

摘要

ChatGPT 作为首个大规模采用的大语言模型(LLM),已在众多自然语言任务中展现出卓越性能。尽管其实用性显而易见,但由于模型的封闭性以及通过人类反馈强化学习(RLHF)持续更新,在多样化问题域中评估 ChatGPT 的性能仍然具有挑战性。我们强调了 ChatGPT 评估中的数据污染问题,并以立场检测任务作为案例研究。我们讨论了在封闭且持续训练的模型时代,防止数据污染并确保公平模型评估所面临的挑战。

关键词

引用

@article{arxiv.2303.12767,
  title  = {Can we trust the evaluation on ChatGPT?},
  author = {Rachith Aiyappa and Jisun An and Haewoon Kwak and Yong-Yeol Ahn},
  journal= {arXiv preprint arXiv:2303.12767},
  year   = {2024}
}