TongGu:掌握基于知识 grounding 的大型语言模型中的古文理解
计算与语言
2024-10-01 v2
摘要
古文是通往中国古代文化底蕴与智慧之门,然而其复杂性对缺乏专业知识的现代人构成巨大的理解障碍。尽管大型语言模型(LLM)在自然语言处理(NLP)中展现出惊人的能力,但在古文理解(CCU)方面仍面临数据需求高且知识密集型任务的挑战。针对这一困境,我们提出了\textbf{TongGu}(意为“理解古今”),即首个专注于古文理解的大型语言模型,其核心贡献体现在三方面:其一,我们构建了源自丰富古文语料库的两阶段指令微调数据集ACCN-INS,旨在发掘LLM在古文理解方的全部潜能;其二,我们提出了冗余感知调优技术(Redundancy-Aware Tuning, RAT),以防止灾难性遗忘,使TongGu能够在保留基础知识的同时获取新能力;其三,我们提出了基于知识 grounding 的古文检索增强生成技术(CCU-RAG),以降低幻觉现象。广泛的24项多样化古文理解任务实验表明,TongGu在古文理解方面展现出卓越的优势,进一步印证了RAT和CCU-RAG的有效性。该模型和数据集已提供于\url{https://github.com/SCUT-DLVCLab/TongGu-LLM}。
关键词
引用
@article{arxiv.2407.03937,
title = {TongGu: Mastering Classical Chinese Understanding with Knowledge-Grounded Large Language Models},
author = {Jiahuan Cao and Dezhi Peng and Peirong Zhang and Yongxin Shi and Yang Liu and Kai Ding and Lianwen Jin},
journal= {arXiv preprint arXiv:2407.03937},
year = {2024}
}