中文

ChatLog:审慎评估 ChatGPT 随时间的演化

计算与语言 2024-06-19 v2 人工智能

摘要

ChatGPT 取得了巨大成功,可被认为已获得基础设施地位。已有大量工作在基准测试上评估 ChatGPT。然而,现有基准测试面临两个挑战:(1)忽视周期性评估和(2)缺乏细粒度特征。在本文中,我们构建了 ChatLog,一个不断更新的数据集,包含自 2023 年 3 月至今针对 21 个 NLP 基准测试的大规模、多样化的 ChatGPT 长文本响应记录。我们进行了全面的性能评估,发现 ChatGPT 的大部分能力随时间提升,除某些能力外,且 ChatGPT 存在阶梯式的演化模式。我们通过提取知识和语言学特征进一步分析了 ChatGPT 的内在特性。我们发现了一些保持不变的稳定特征,并将其应用于 ChatGPT 生成文本的检测,以提高跨版本检测的鲁棒性。我们将持续维护我们的项目:\url{https://github.com/THU-KEG/ChatLog/}。

关键词

引用

@article{arxiv.2304.14106,
  title  = {ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time},
  author = {Shangqing Tu and Chunyang Li and Jifan Yu and Xiaozhi Wang and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2304.14106},
  year   = {2024}
}

备注

30 pages