通过编码对话上下文生成微博标签
计算与语言
2019-05-21 v1
摘要
自动标签标注在微博帖子的内容理解中起着重要作用。迄今为止,该领域的进展局限于从有限候选中进行短语选择,或使用主题模型进行词级标签发现。与以往将标签视为不可分整体的工作不同,我们的工作首次尝试以新颖的序列生成框架来标注标签,将标签视为词的短序列。此外,为处理短微博帖子中的数据稀疏问题,我们提出用双向注意力联合建模目标帖子及其引发的对话上下文。在新收集的英文 Twitter 和中文 Weibo 两个大规模数据集上的大量实验结果表明,我们的模型显著优于基于分类的 SOTA 模型。进一步的研究表明,我们能有效生成稀有甚至未出现的标签,而这是大多数现有方法无法做到的。
引用
@article{arxiv.1905.07584,
title = {Microblog Hashtag Generation via Encoding Conversation Contexts},
author = {Yue Wang and Jing Li and Irwin King and Michael R. Lyu and Shuming Shi},
journal= {arXiv preprint arXiv:1905.07584},
year = {2019}
}
备注
NAACL 2019 (10 pages)