面向修辞角色标注的层次化架构:整合局部上下文与全局语义原型
计算与语言
2026-03-05 v1
摘要
修辞角色标注(RRL)识别文档中每个句子的功能角色,是理解语篇结构在法律、医疗等领域的关键任务。虽然层次化模型在捕获局部依赖方面有效,但在建模全局、语料库级别特征方面受限。为此,我们提出两种基于原型的方法,将局部上下文与全局表示相结合。基于距离的辅助损失学习软原型,以结构化潜在空间为目标的原型正则化(PBR),以及构建语料库级别原型并在训练与推理期注入的原型条件调制(PCM)。鉴于 RRL 资源稀缺,我们引入 SCOTUS-Law,这是首个标注了美国最高法院意见书中修辞角色的语料库,包含三个层次的细粒度:类别、修辞功能与步骤。实验表明,在法律、医疗和科学基准测试中,我们的方法 consistently 超越强大基线,对低频角色实现 4 个 Macro-F1 的提升。我们进一步分析了在大语言模型时代的意义,并通过专家评估补充了我们的发现。
引用
@article{arxiv.2603.03856,
title = {Coupling Local Context and Global Semantic Prototypes via a Hierarchical Architecture for Rhetorical Roles Labeling},
author = {Anas Belfathi and Nicolas Hernandez and Laura Monceaux and Warren Bonnard and Mary Catherine Lavissiere and Christine Jacquin and Richard Dufour},
journal= {arXiv preprint arXiv:2603.03856},
year = {2026}
}
备注
Accepted at EACL 2026