我能理解我创造的东西吗?大语言模型的自我知识评估
计算与语言
2024-06-11 v1 机器学习
摘要
大语言模型(LLMs)在语言任务上取得了显著进展,亟需稳健的评估框架来理解其能力与局限性。以费曼理解通过创造来理解为灵感,我们引入一种自我知识评估框架,易于实现,评估模型对自生成问题的理解与响应能力。我们的发现表明,基于对多种模型进行多样化任务测试,模型的自我知识能力存在显著差距。进一步分析表明,这些差距可能源于与人类注意力机制的错位。此外,针对自生成的数学任务进行微调可提升模型的数学性能,这凸显了该评估框架对于高效且富有洞察力的模型评估潜力,亦可能有助于改进大语言模型。
引用
@article{arxiv.2406.06140,
title = {Can I understand what I create? Self-Knowledge Evaluation of Large Language Models},
author = {Zhiquan Tan and Lai Wei and Jindong Wang and Xing Xie and Weiran Huang},
journal= {arXiv preprint arXiv:2406.06140},
year = {2024}
}