POSLAN:利用位置与语言编码的帖子嵌入解耦聊天线程
计算与语言
2021-07-09 v1
摘要
大多数在线消息线程天生杂乱,任何新用户或中断后重返的现有用户都难以理解线程中正在讨论的内容。同样,消息线程中杂乱的回复使得消息分析成为难题。当讨论所在平台不提供检索消息回复关系的功能时,解耦杂乱的需求更为迫切。这引入了一个有趣的问题,Wang等人(2011)将其表述为结构学习问题。我们为线程中的帖子创建向量嵌入,以捕获给定消息所处上下文中语言和位置特征。利用这些帖子嵌入,我们计算基于相似度的连接矩阵,随后将其转换为图。在采用剪枝机制后,所得图可用于发现线程中帖子的回复关系。发现或解耦聊天的过程保持为无监督机制。我们在从Telegram获取的、元数据有限的数据集上展示了实验结果。
引用
@article{arxiv.2107.03529,
title = {POSLAN: Disentangling Chat with Positional and Language encoded Post Embeddings},
author = {Bhashithe Abeysinghe and Dhara Shah and Chris Freas and Robert Harrison and Rajshekhar Sunderraman},
journal= {arXiv preprint arXiv:2107.03529},
year = {2021}
}