以台湾客家文化为案例评估大语言模型认知领域能力的基准
计算与语言
2024-09-26 v2 人工智能
摘要
本研究引入一个综合性基准,用于评估大语言模型 (LLM) 在理解和处理文化知识方面的性能,具体聚焦于客家文化。该基准利用布卢姆斯分类学,构建一个多维框架,系统性地评估 LLM 在六个认知领域:记忆 (Remembering)、理解 (Understanding)、应用 (Applying)、分析 (Analyzing)、评估 (Evaluating) 和创造 (Creating) 上的能力。该基准超越传统单维度评估,提供对 LLM 处理特定文化内容能力的深入分析,涵盖从基本事实记忆到高阶认知任务(如创意综合)等多个层面。此外,本研究整合了检索增强生成 (RAG) 技术,以解决少数群体文化知识在 LLM 中代表性不足的问题,表明 RAG 通过动态整合相关外部信息来提升模型性能。结果显示,RAG 在提升所有认知领域的准确度方面均显示出效果,尤其在需要精确检索和应用文化知识的任务中效果显著。然而,发现 RAG 在创意任务中的局限性,凸显了仍需进一步优化的需求。该基准为在文化多样化语境中评估和比较 LLM 提供了强大的工具,为未来在 AI 驱动的文化知识保存与传播方面的研究与发展提供了宝贵见解。
引用
@article{arxiv.2409.01556,
title = {Benchmarking Cognitive Domains for LLMs: Insights from Taiwanese Hakka Culture},
author = {Chen-Chi Chang and Ching-Yuan Chen and Hung-Shin Lee and Chih-Cheng Lee},
journal= {arXiv preprint arXiv:2409.01556},
year = {2024}
}
备注
Accepted to O-COCOSDA 2024