DepNeCTI:基于依存关系的梵语嵌套复合类型识别
计算与语言
2023-10-17 v1
摘要
多成分复合是梵语中普遍存在的现象,理解复合成分间的隐式结构对于解读其含义至关重要。梵语以往的研宄聚焦于二元复合,忽视了多成分复合设定。本文提出新任务——嵌套复合类型识别(NeCTI),旨在识别多成分复合的嵌套跨度并解码它们之间的隐式语义关系。据我们所知,这是词汇语义学领域首次尝试提出该任务。我们提供两个新标注数据集,包括一个域外数据集。我们还通过探索嵌套命名实体识别、成分句法分析和 seq2seq 等标准问题表述的效力来对这些数据集进行基准测试。我们提出名为 DepNeCTI(基于依存关系的嵌套复合类型识别器)的新框架,其在标注跨度得分(LSS)上以平均绝对提升 13.1 个 F1 分数点超越最佳基线,并将推理效率提升 5 倍。与先前梵语二元复合识别任务的发现一致,上下文对 NeCTI 任务有益。代码库与数据集公开于:https://github.com/yaswanth-iitkgp/DepNeCTI
引用
@article{arxiv.2310.09501,
title = {DepNeCTI: Dependency-based Nested Compound Type Identification for Sanskrit},
author = {Jivnesh Sandhan and Yaswanth Narsupalli and Sreevatsa Muppirala and Sriram Krishnan and Pavankumar Satuluri and Amba Kulkarni and Pawan Goyal},
journal= {arXiv preprint arXiv:2310.09501},
year = {2023}
}
备注
9 Pages, Camera-ready version accepted at EMNLP23 (Findings)