中文

潜在特征与跨任务迁移:解构大语言模型微调中的数据集相互作用

计算与语言 2025-11-11 v2 机器学习

摘要

大型语言模型正在跨越 diverse applications 部署。这通常包括大模型在训练期间未遇到的任务。这意味着不可能枚举并获取所有任务的高质量训练数据。因此,我们常常需要依赖使用不同特征的数据集进行迁移学习,并预期出现非分布请求。受此实际需求的启发,我们提出了一个分析框架,构建转移学习矩阵和降维,以剖析这些跨任务相互作用。我们训练和分析 10 个模型以识别潜在能力(例如推理、情感分类、NLU、算术),并发现迁移学习的副作用。我们的发现表明,绩效改进往往违背基于表层数据集相似性或源数据质量的解释。相反,源数据集的隐藏统计因素(如类别分布和生成长度倾向)以及特定语言特征实际上更具影响力。这项工作为理解迁移学习的复杂动态提供了见解,为实现更可预测和有效的大语言模型适应铺平了道路。

关键词

引用

@article{arxiv.2509.13624,
  title  = {Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning},
  author = {Shambhavi Krishna and Atharva Naik and Chaitali Agarwal and Sudharshan Govindan and Taesung Lee and Haw-Shiuan Chang},
  journal= {arXiv preprint arXiv:2509.13624},
  year   = {2025}
}

备注

Proceedings of the 14th Joint Conference on Lexical and Computational Semantics (*SEM 2025)