这看起来熟悉吗?通过模型内部表征进行知识分析
计算与语言
2025-09-10 v1 人工智能
摘要
大型语言模型(LLMs)的最新进展是由预训练、监督微调(SFT)和对齐微调驱动的。其中,SFT 在将模型的通用知识转化为针对特定任务的结构化响应方面起着至关重要的作用。然而,目前还没有明确建立的有效训练数据选择方法。简单地增加数据量并不能保证性能提升,而预处理、采样和验证则需要大量的时间和成本。为了解决这个问题,人们提出了多种数据选择方法。其中,基于知识的选择方法通过分析模型的响应来识别合适的训练数据。然而,这些方法通常依赖于提示工程,使其对变化敏感,并为提示设计带来额外成本。在本研究中,我们提出了通过模型内部表征进行知识分析(KAMIR),这是一种通过基于模型内部表征分析数据来克服这些局限性的新方法。KAMIR 计算每一层(块)的隐藏状态与给定输入的最终隐藏状态之间的相似度来评估数据。与以往主要局限于多项选择任务的方法不同,KAMIR 可以应用于广泛的任务,如机器阅读理解和摘要。此外,它基于模型对输入的熟悉程度来选择对训练有用的数据,即使使用小数据集和简单的分类器架构也能实现。在多样化任务数据集上的实验表明,使用不太熟悉的数据进行训练能带来更好的泛化性能。
引用
@article{arxiv.2509.07311,
title = {Does This Look Familiar to You? Knowledge Analysis via Model Internal Representations},
author = {Sihyun Park},
journal= {arXiv preprint arXiv:2509.07311},
year = {2025}
}