中文

基于神经切线核选取辅助数据的低资源域方法

计算与语言 2025-11-11 v1

摘要

大型语言模型 (LLM) 已在广泛任务上取得显著成功,但其在低资源领域的应用仍面临数据稀缺和易过拟合的重大挑战。尽管领域内数据有限,但存在大量类似的通用领域数据,我们的初始发现表明,这些数据可能作为辅助监督用于域增强。由此引出我们的核心研究问题:\textbf{\textit{如何有效选择最有价值的辅助数据以最大化领域特定性能}},特别是当传统方法因缺乏大型领域内数据池或验证集而不可行时。为此,我们提出\textbf{NTK-Selector},一个原则且高效的框架,用于通过神经切线核 (NTK) 选择通用领域辅助数据以增强领域特定性能。我们的 метод通过经验性地证明 LLM 在 LoRA 微调期间表现出稳定的类似 NTK 行为,并提出一种无 Jacobian 的近似方法。广泛的实验覆盖四个低资源领域 (医疗、金融、法律和心理),结果表明 NTK-Selector 在下游任务中一致实现性能提升。具体而言,仅在 1000 份领域内样本上微调仅获得 Llama3-8B-Instruct 和 Qwen3-8B 分别提升 0.8 分和 0.9 分。相比之下,通过 NTK-Selector 选取的 9000 份辅助样本导致 \textbf{性能提升 \textbf{+8.7 和 +5.1 分}},相当于 \textbf{在仅使用领域数据时情境下的 10.9 倍和 5.7 倍提升}。

关键词

引用

@article{arxiv.2511.07380,
  title  = {Selecting Auxiliary Data via Neural Tangent Kernels for Low-Resource Domains},
  author = {Pingjie Wang and Hongcheng Liu and Yusheng Liao and Ziqing Fan and Yaxin Du and Shuo Tang and Yanfeng Wang and Yu Wang},
  journal= {arXiv preprint arXiv:2511.07380},
  year   = {2025}
}

备注

27 pages