讨论如何进行:社交媒体对话中的话语行为分类
计算与语言
2019-07-16 v1 社会与信息网络
摘要
我们提出一种基于注意力的层次化LSTM模型,用于分类社交媒体对话中的话语行为序列,旨在利用句子层面之上的文本意义从在线讨论中挖掘数据。该任务非常独特之处在于对非正式文本讨论中可能的语用角色进行完整归类,这与问答抽取、立场检测或讽刺识别等高度角色特定的任务相反。早期尝试基于Reddit讨论数据集进行。我们在相同数据上训练模型,并在两个不同数据集(一个来自Reddit,一个来自Facebook)上给出测试结果。我们提出的模型在领域独立性方面优于先前模型;在不使用平台相关结构特征的情况下,我们的带词相关性注意力机制的层次化LSTM在预测Reddit与Facebook讨论中评论的话语角色时分别取得了71%与66%的F1分数。本文提出并分析了循环与卷积架构在同一任务上学习话语表示的效率,采用了不同的词与评论嵌入方案。我们的注意力机制使我们能够探究文本片段根据其话语角色的相关性排序。我们呈现了一项人类标注者实验,以揭示关于建模与数据标注的重要观察。借助我们的基于文本的话语识别模型,我们探究了位置、时间、信息倾向等异质非文本特征如何在刻画Facebook在线讨论中发挥作用。
引用
@article{arxiv.1808.02290,
title = {How did the discussion go: Discourse act classification in social media conversations},
author = {Subhabrata Dutta and Tanmoy Chakraborty and Dipankar Das},
journal= {arXiv preprint arXiv:1808.02290},
year = {2019}
}