中文

猫、鼠、喵:论语言模型与人类术语相似性判断的对齐

机器学习 2025-04-11 v1 计算与语言

摘要

中小型生成式语言模型正受到越来越多的关注。其规模和可用性使其适合在行为和表征层面进行分析,从而能够研究这些层面如何相互作用。我们评估了 32 个公开可用的语言模型在词三元组任务上与人类相似性判断的表征和行为对齐。这提供了一种新颖的评估设置,以探查语言中超越常见成对比较的语义关联。我们发现:(1)即使是小型语言模型的表征也能达到人类水平的对齐;(2)经过指令微调的模型变体可以表现出显著增加的一致性;(3)跨层的对齐模式高度依赖于模型;(4)基于模型行为响应的对齐高度依赖于模型大小,且仅对于最大的被评估模型才与其表征对齐相匹配。

关键词

引用

@article{arxiv.2504.07965,
  title  = {Cat, Rat, Meow: On the Alignment of Language Model and Human Term-Similarity Judgments},
  author = {Lorenz Linhardt and Tom Neuhäuser and Lenka Tětková and Oliver Eberle},
  journal= {arXiv preprint arXiv:2504.07965},
  year   = {2025}
}

备注

ICLR 2025 Workshop on Representational Alignment (Re-Align)