弥合专家模型与语言模型之间的差距:概念引导的国际象棋解说生成与评估
机器学习
2025-02-11 v2 人工智能
计算与语言
摘要
基于深度学习的专家模型在国际象棋和围棋等决策领域已达到超人类的表现。然而,尽管这对于模型可解释性和人类教育非常重要,但对给定决策进行解释或评论仍未被充分探索。专家模型的输出准确,但人类难以解释。另一方面,大型语言模型 (LLMs) 可以产生流畅的解说,但由于其决策能力有限,容易产生幻觉。为了弥合专家模型与 LLMs 之间的这一差距,我们以国际象棋解说作为通过语言解释复杂决策过程的代表性任务,并同时解决解说的生成与评估问题。我们引入了概念引导的国际象棋解说生成 (CCC) 用于生成解说,以及基于 GPT 的国际象棋解说评估 (GCC-Eval) 用于对其进行评估。CCC 通过基于优先级的、基于概念的解释,将专家模型的决策优势与 LLMs 的语言流畅性相结合。GCC-Eval 利用专家知识,从信息量和语言质量两方面评估国际象棋解说。经人类评判和 GCC-Eval 验证的实验结果表明,CCC 生成的解说准确、信息丰富且流畅。
引用
@article{arxiv.2410.20811,
title = {Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and Evaluation},
author = {Jaechang Kim and Jinmin Goh and Inseok Hwang and Jaewoong Cho and Jungseul Ok},
journal= {arXiv preprint arXiv:2410.20811},
year = {2025}
}
备注
Appears in NAACL 2025