中文

语言模型作为层级编码器

计算与语言 2024-11-22 v4 人工智能 机器学习

摘要

解释语言中潜在的层级结构是当前语言模型的一个关键局限。尽管先前研究已隐式利用这些层级来增强语言模型,但对其显式编码的方法仍有待探索。为解决此问题,我们引入一种新方法,将基于 Transformer 编码器的语言模型重新训练为层级 Transformer 编码器,利用双曲空间的广阔特性。该方法将预训练语言模型的输出嵌入空间置于一个曲率随嵌入维度自适应的 Poincaré 球中,随后在双曲聚类和向心损失上进行训练。这些损失旨在有效地对相关实体(以文本形式输入)进行聚类并按层级组织。我们针对预训练语言模型、标准微调语言模型及若干双曲嵌入基线对 HiTs 进行评估,重点关注其在模拟传递推理、预测包含关系及跨层级知识迁移方面的能力。结果表明,HiTs 在这些任务中始终优于所有基线,凸显了我们重新训练的层级编码器的有效性与可迁移性。

关键词

引用

@article{arxiv.2401.11374,
  title  = {Language Models as Hierarchy Encoders},
  author = {Yuan He and Zhangdie Yuan and Jiaoyan Chen and Ian Horrocks},
  journal= {arXiv preprint arXiv:2401.11374},
  year   = {2024}
}

备注

Accept at NeurIPS 2024