KeyGen2Vec:基于社区问答多标签关键词生成的文档嵌入学习
计算与语言
2023-10-31 v1
摘要
在保持文档源之间结构相似性的同时将文档表示到高维嵌入空间中,一直是许多文本表示学习工作的终极目标。然而,当前的嵌入模型主要依赖标签监督的可用性来提升所得嵌入的表达能力。相比之下,无监督嵌入成本低廉,但它们往往无法捕捉目标语料库中的隐含结构,特别是对于来自与预训练源不同分布的样本。我们的研究旨在通过序列到序列(Seq2Seq)文本生成器学习文档嵌入,从而放宽对标签监督的依赖。具体而言,我们将关键短语生成任务重新表述为基于社区的问答(cQA)中的多标签关键词生成。我们的实证结果表明,基于纯度(Purity)、归一化互信息(NMI)和 F1 分数指标,KeyGen2Vec 总体上优于多标签关键词分类器达 14.7%。有趣的是,尽管通过标签监督学习嵌入的绝对优势在评估数据集上总体高度为正,但 KeyGen2Vec 在具有更大量潜在主题标签的 Yahoo! cQA 中,被证明与利用主题标签监督的分类器具有竞争力。
引用
@article{arxiv.2310.19650,
title = {KeyGen2Vec: Learning Document Embedding via Multi-label Keyword Generation in Question-Answering},
author = {Iftitahu Ni'mah and Samaneh Khoshrou and Vlado Menkovski and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2310.19650},
year = {2023}
}
备注
Arxiv preprint