语言模型中的涌现语义角色理解
人工智能
2026-05-12 v1 计算与语言
机器学习
摘要
理解语言模型如何在数据中涌现语义结构,对于解释这些系统从数据中学习什么以及它们真正需要多少监督信息至关重要。特别是,语义角色理解("谁对什么人做了什么")是意义表示的核心组成部分,但仍不清楚它是源于预训练alone还是依赖于任务特定的微调。我们研究语义角色理解是否在语言模型预训练期间涌现,或者需要任务特定的微调。我们冻结解码器-only变压器,并训练线性探针来提取语义角色,通过性能来推断角色信息是否已编码在预训练中,或者是在适应期间学习的。我们发现,冻结的表示包含大量语义角色信息,性能虽提升,但未完全匹配微调模型。这表明预训练alone只能部分涌现。我们表明语义角色结构源于语言建模目标,但其内部实现随模型规模的增加而向更分布式的表征形式转变。
引用
@article{arxiv.2605.09187,
title = {Emergent Semantic Role Understanding in Language Models},
author = {Carla Griffiths and Mirco Musolesi},
journal= {arXiv preprint arXiv:2605.09187},
year = {2026}
}