中文

从文档到片段:主题分配的情境化重构

计算与语言 2026-05-19 v1

摘要

传统话语模型为每个文档分配单个主题。然而,实际中许多文档(如产品评论或开放式调查响应)包含多个distinct主题。这种不匹配常导致 topic 交叉 contamination,即无关主题被合并到单个主题中,难以识别真正聚焦于特定主题的文档。我们通过引入基于片段的话题分配 (SBTA),将话语模型重构为将主题分配给片段:每个片段是表达单个主题的短而连贯的文本span。通过在片段层面建模话语结构,Our 方法yield cleaner and more interpretable topics,并更好地支持多主题文档的分析。为支持系统评估,我们构建了 SemEval-STM,一个受方面情感分析启发的新数据集。文档首先被分解为使用大型语言模型 (LLM) 的topical segments,然后进行人工细化以确保片段质量。我们还提出了片段水平的 word intrusion 任务的扩展,使在实际分配话语的细粒度上进行人类评估成为可能。在多个模型和评估指标上,我们展示了 SBTA 在聚类质量和可解释性方面的提升。总体而言,本工作提供了一个实用且可扩展的框架,用于对异构文本语料库中的细粒度话语分析,其中文档自然跨越多个话题。URL: https://huggingface.co/datasets/LG-AI-Research/SemEval-STM

关键词

引用

@article{arxiv.2605.17714,
  title  = {From Documents to Segments: A Contextual Reformulation for Topic Assignment},
  author = {Hoonsang Yoon and Takyoung Kim and Wonkee Lee and Ilmin Cho and Dilek Hakkani-Tür and Stanley Jungkyu Choi},
  journal= {arXiv preprint arXiv:2605.17714},
  year   = {2026}
}

备注

Findings of ACL 2026