中文

无监督句子表示作为词信息序列:重访 TF-IDF

计算与语言 2017-10-23 v2

摘要

语义层面的句子表示是自然语言处理和人工智能的一项具有挑战性的任务。尽管词嵌入(即词向量表示)取得了进展,但由于词之间语义交互的复杂性,捕捉句子含义仍是一个开放问题。在本文中,我们提出一种嵌入方法,旨在从未标注文本中学习无监督句子表示。我们提出一种无监督方法,将句子建模为词嵌入的加权序列。词嵌入的权重通过使用术语频率-逆文档频率(TF-IDF)变换提供的香农词熵来拟合。模型的超参数可根据数据属性(例如句子长度和文本性别)选择。超参数选择涉及词嵌入方法与维度,以及加权方案。我们的方法相较于现有方法具有优势:可识别的模块、短期训练、对(未见过的)句子表示的在线推断,以及独立于领域、外部知识和语言资源。结果表明,我们的模型在知名的语义文本相似度(STS)基准上优于最先进水平。此外,与有监督和基于知识的 STS 系统相比,我们的模型达到了最先进的性能。

关键词

引用

@article{arxiv.1710.06524,
  title  = {Unsupervised Sentence Representations as Word Information Series: Revisiting TF--IDF},
  author = {Ignacio Arroyo-Fernández and Carlos-Francisco Méndez-Cruz and Gerardo Sierra and Juan-Manuel Torres-Moreno and Grigori Sidorov},
  journal= {arXiv preprint arXiv:1710.06524},
  year   = {2017}
}