中文

让大语言模型应对最新挑战!一个中文动态问答基准

计算与语言 2024-03-05 v2

摘要

如何更好地评估大语言模型(LLMs)的能力是当前LLMs研究的焦点和热点。先前的工作指出,由于LLMs迭代更新的成本极高,它们往往无法很好地回答最新的动态问题。为了促进中文LLMs回答动态问题能力的提升,本文介绍了CDQA,一个包含中文互联网最新新闻相关问答对的中文动态问答基准。我们通过结合人类和模型的流水线获得高质量数据,并根据答案变化频率仔细分类样本,以便更细粒度地观察LLMs的能力。我们还在CDQA上评估和分析了主流和先进的中文LLMs。大量实验和有价值的见解表明,我们提出的CDQA具有挑战性,值得进一步研究。我们相信,我们提供的基准将成为未来提升LLMs中文问答能力的关键数据资源之一。

关键词

引用

@article{arxiv.2402.19248,
  title  = {Let LLMs Take on the Latest Challenges! A Chinese Dynamic Question Answering Benchmark},
  author = {Zhikun Xu and Yinghui Li and Ruixue Ding and Xinyu Wang and Boli Chen and Yong Jiang and Hai-Tao Zheng and Wenlian Lu and Pengjun Xie and Fei Huang},
  journal= {arXiv preprint arXiv:2402.19248},
  year   = {2024}
}

备注

Work in progress!