中文

HICL:面向社交媒体自然语言理解的标签驱动上下文学习

计算与语言 2024-04-17 v1

摘要

自然语言理解(NLU)是各类社交媒体应用的核心组成部分。然而,现有 NLU 模型严重依赖上下文进行语义学习,在面对简短且含噪的社交媒体内容时性能受损。为解决此问题,我们利用上下文学习(ICL)——语言模型通过以少量示例为条件进行推理,从而丰富上下文——并提出一种新颖的标签驱动上下文学习(HICL)框架。具体而言,我们预训练了一个 #Encoder 模型,该模型利用 #标签(用户标注的主题标签)通过对比学习驱动基于 BERT 的预训练。我们的目标在于使 #Encoder 获得融入主题相关语义信息的能力,从而使其能够检索主题相关帖子以丰富上下文,并增强含噪上下文下的社交媒体 NLU。为进一步将检索到的上下文与源文本融合,我们采用基于梯度的方法识别有助于融合两源信息的触发词。在实证研究中,我们收集了 4500 万条推文以构建上下文 NLU 基准,在七项下游任务上的实验结果表明 HICL 大幅推进了先前的最优结果。此外,我们进行了大量分析并发现:(1)将源输入与来自 #Encoder 的 top 检索帖子结合比使用语义相似帖子更有效;(2)触发词可在很大程度上有益于融合源帖子与检索帖子中的上下文。

关键词

引用

@article{arxiv.2308.09985,
  title  = {HICL: Hashtag-Driven In-Context Learning for Social Media Natural Language Understanding},
  author = {Hanzhuo Tan and Chunpu Xu and Jing Li and Yuqun Zhang and Zeyang Fang and Zeyu Chen and Baohua Lai},
  journal= {arXiv preprint arXiv:2308.09985},
  year   = {2024}
}

备注

https://github.com/albertan017/HICL