推进繁体中文语言模型评测:迈向综合基准套件
计算与语言
2023-10-03 v2
摘要
大语言模型的评测是语言理解与生成领域的一项基本任务。随着语言模型的持续发展,对有效基准以评估其性能的需求已变得迫在眉睫。在繁体中文语境下,尽管已存在 DRCD、TTQA、CMDQA 与 FGC 数据集等若干基准,仍缺乏全面且多样的基准来评估语言模型的能力。为弥补这一缺口,我们提出一组新颖的基准,其利用现有英文数据集并专为繁体中文下的语言模型评测而定制。这些基准涵盖广泛任务,包括上下文问答、摘要、分类与表格理解。所提基准提供了一个综合评测框架,使得能够在不同任务上评估语言模型的能力。本文中,我们在这些基准上评测了 GPT-3.5、Taiwan-LLaMa-v1.0 以及我们的专有模型 Model 7-C 的性能。评测结果突显我们的模型 Model 7-C 在部分被评测能力上取得了与 GPT-3.5 相当的性能。为推动繁体中文语言模型评测并刺激该领域的进一步研究,我们已开源我们的基准并开放模型试用。
引用
@article{arxiv.2309.08448,
title = {Advancing the Evaluation of Traditional Chinese Language Models: Towards a Comprehensive Benchmark Suite},
author = {Chan-Jan Hsu and Chang-Le Liu and Feng-Ting Liao and Po-Chun Hsu and Yi-Chang Chen and Da-shan Shiu},
journal= {arXiv preprint arXiv:2309.08448},
year = {2023}
}