中文

ORCHID:面向目标无关 stance 检测与论证式对话摘要的中文辩论语料库

计算与语言 2024-10-18 v1

摘要

对话代理人正受到日益关注的注意力,这一趋势 further 被推动了大型语言模型 (LLM) 最近的进展。立场检测和对话摘要是涉及论证式对话的对话代理应用场景中的两个核心任务。然而,这些任务的研究受限于公共数据集的不足,尤其是针对非英语语言。为填补这一语言资源差距,本文提出了 ORCHID(Oral Chinese Debate),即第一个面向目标无关 stance 检测和辩论摘要的中文数据集。我们的数据集包含 1218 场在中文上进行的真实世界辩论,涵盖 476 个独特主题,包含 2436 条针对 stance 的摘要和 14,133 条完整标注的言论。除了为未来研究提供多功能的测试平台外,我们还对数据集进行了经验研究,提出了一个集成任务。结果表明该数据集具有挑战性,并提示在论证式对话中将 stance 检测纳入摘要的潜力。

关键词

引用

@article{arxiv.2410.13667,
  title  = {ORCHID: A Chinese Debate Corpus for Target-Independent Stance Detection and Argumentative Dialogue Summarization},
  author = {Xiutian Zhao and Ke Wang and Wei Peng},
  journal= {arXiv preprint arXiv:2410.13667},
  year   = {2024}
}

备注

In EMNLP 2023