KnowCoder-X:通过代码提升多语言信息抽取
计算与语言
2025-06-03 v3 人工智能
机器学习
摘要
经验证明,大语言模型(LLM)在跨语言对齐方面表现出自发的对齐能力。然而,尽管LLM在信息抽取(IE)中显示出良好的跨语言对齐,但在不同语言之间仍存在显著的不平衡,这凸显了潜在的缺陷。为此,我们提出KnowCoder-X,这是一个强大的代码LLM,具备先进的跨语言和多语言能力,用于通用IE。首先,它使用Python类标准化多语言模式的表示,确保不同语言之间的一致本体。随后,将IE跨语言对齐指令调优应用于翻译实例预测任务,以增强模型的跨语言迁移能力。在此阶段,我们还构建了一个高质量且多样化的双语IE平行数据集,称为ParallelNER,包含25.7k个样本,通过我们提出的稳健三阶段管线合成,并进行手动标注以确保质量。虽然在29个未见语言上没有进行训练,KnowCoder-X仍超过ChatGPT 30.17%,超过SOTA 20.03%,从而展示了其在跨语言IE方面的优越性能。对64个在中文和英文下的各种设置下的全面评估表明,KnowCoder-X通过提升IE对齐,显著增强了跨语言IE迁移。我们的代码和数据集已提供于:https://github.com/ICT-GoKnow/KnowCoder。
关键词
引用
@article{arxiv.2411.04794,
title = {KnowCoder-X: Boosting Multilingual Information Extraction via Code},
author = {Yuxin Zuo and Wenxuan Jiang and Wenxuan Liu and Zixuan Li and Long Bai and Hanbin Wang and Yutao Zeng and Xiaolong Jin and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2411.04794},
year = {2025}
}
备注
ACL 2025 Findings