中文

你能通过下一个词预测学习语义吗?蕴含的情况

计算与语言 2024-07-18 v3

摘要

语言模型(LMs)是否从其训练数据的共现模式中推断出文本的语义?Merrill 等人(2022)从理论上论证,最优 LM 预测的句子共现概率应反映组成句子之间的蕴含关系,但由于 Merrill 等人做出了强有力的假设(即人类总是避免冗余),目前尚不清楚神经 LM 预测的概率是否以这种方式编码了蕴含关系。在这项工作中,我们研究了他们的理论是否可用于从神经 LM 中解码蕴含关系。我们发现,类似于他们的测试可以在许多数据集和 LM 上解码自然句子之间的蕴含关系,效果远高于随机机会,尽管并不完美。这表明 LM 隐式地对语义的各个方面进行建模,以预测句子共现模式的语义效应。然而,我们发现实际中预测蕴含的测试方向与理论测试相反。因此,我们重新审视了原始测试背后的假设,发现其推导未能充分考虑到人类书写文本中的冗余。我们认为,更好地考虑与解释相关的冗余可能会推导出观察到的翻转测试,并且更普遍地,改进语言学中说话者的计算模型。

关键词

引用

@article{arxiv.2402.13956,
  title  = {Can You Learn Semantics Through Next-Word Prediction? The Case of Entailment},
  author = {William Merrill and Zhaofeng Wu and Norihito Naka and Yoon Kim and Tal Linzen},
  journal= {arXiv preprint arXiv:2402.13956},
  year   = {2024}
}