LLM原子命题助力弱提取器:针对三元组提取的Propositioner评估
计算与语言
2026-04-06 v1
摘要
从自然语言构建知识图谱需要从复杂、信息密集的句子中提取结构化三元组。本文研究将文本分解为原子命题(信息最小且在语义上自治的单元)是否可以提高三元组提取效果。我们引入MPropositionneur-V2,一个覆盖六种欧洲语言的小型多语言模型,通过从Qwen3-32B进行知识蒸馏到Qwen3-0.6B架构中训练,评估其集成到两种提取范例:实体中心(GLiREL)和生成式(Qwen3)。在SMiLER、FewRel、DocRED和CaRB上进行实验,表明原子命题对较弱的提取器(GLiREL、CoreNLP、0.6B模型)有益,提升了关系召回率以及在多语言设置下的总体准确率。对于更强的大语言模型,一种后备组合策略在保持关系提取收益的同时恢复实体召回率损失。这些结果表明,原子命题是一种可解释的中间数据结构,能在不取代提取器的情况下补充提取效果。
引用
@article{arxiv.2604.02866,
title = {LLM-based Atomic Propositions help weak extractors: Evaluation of a Propositioner for triplet extraction},
author = {Luc Pommeret and Thomas Gerald and Patrick Paroubek and Sahar Ghannay and Christophe Servan and Sophie Rosset},
journal= {arXiv preprint arXiv:2604.02866},
year = {2026}
}