从语义角色到意见角色:面向低资源ORL任务的SRL数据抽取与多任务迁移学习
计算与语言
2025-11-12 v1
摘要
本报告详细阐述了从《华盛顿邮报》语料库的OntoNotes 5.0中抽取高质量语义角色标注(SRL)数据的 methodology,并将其适用于意见角色标注(ORL)任务。我们利用PropBank标注框架,实现一个可复现的抽取管道,将谓词-论元结构与surface text对齐,将句法树指针转换为连贯的span,并应用严格的清洗以确保语义忠实。 resulting 数据集包含 97,169 个谓词-论元实例,明确定义了Agent(ARG0)、Predicate(REL)和Patient(ARG1)角色,并映射到ORL的Holder、Expression和Target模式。我们详细阐述了抽取算法、不连续论元处理、标注纠正以及结果数据集的统计分析。本工作为寻求利用SRL增强ORL、尤其是低资源意见抽取场景的研究者提供了可复用的资源。
引用
@article{arxiv.2511.08537,
title = {From Semantic Roles to Opinion Roles: SRL Data Extraction for Multi-Task and Transfer Learning in Low-Resource ORL},
author = {Amirmohammad Omidi Galdiani and Sepehr Rezaei Melal and Mohammad Norasteh and Arash Yousefi Jordehi and Seyed Abolghasem Mirroshandel},
journal= {arXiv preprint arXiv:2511.08537},
year = {2025}
}
备注
12 pages, 16 figures