中文

从对话中提取三元组用于对话式社交智能体

计算与语言 2024-12-25 v1

摘要

获取 Hybrid Intelligence 协作中沟通的明确理解对于创建可控且透明的智能体至关重要。本文描述了若干自然语言理解模型,从社交对话中提取显式符号三元组。三元组提取主要用于知识库完成,使用维基百科文本和数据进行训练和测试。然而,社交对话作为一种体裁,与之不同,双方以包含陈述、问题和答案的连续话语来交换信息。在共指、省略、协调以及隐式或显式否定或确认等现象在对话中比维基百科文本更为突出。因此,我们描述了填补这一差距的尝试,通过发布用于训练和测试从社交对话中提取三元组的数据集。我们还创建了五个三元组提取模型并在评估数据中进行测试。单个话语上的最高精度为完整三元组的 51.14%,三元组元素的 69.32%。然而,跨越多个回合的对话三元组得分要低得多,这表明从真正的对话数据中提取知识要比从维基百科文本中更具挑战性。

关键词

引用

@article{arxiv.2412.18364,
  title  = {Extracting triples from dialogues for conversational social agents},
  author = {Piek Vossen and Selene Báez Santamaría and Lenka Bajčetić and Thomas Belluci},
  journal= {arXiv preprint arXiv:2412.18364},
  year   = {2024}
}