面向噪声鲁棒的金融数值实体属性标注
人工智能
2026-05-26 v1 计算工程、金融与科学
摘要
金融数值实体(FNE)理解旨在恢复数值提及的意义。现有研究主要聚焦于概念名称预测,面临两个重要局限:其一,来自内联 XBRL 的标签可能包含错误,因为披露文件通常由人工准备;其二,其他重要 FNE 属性(如报告时序关系、度量尺度和会计符号)受到忽视。我们提出了基于任务感知的实例特定加权,以减轻噪声标签在训练中的影响的 \textbf{NO}ise-\textbf{R}obust Tagging for Rich Financial Numerical Entity \textbf{A}ttributes(\textsc{NORA})框架,以解决上述问题。\textsc{NORA} 使用任务感知的实例特定加权来减轻训练中噪声标签的影响,并进一步提出了邻域先验调整 KNN(NPK)过滤方法,以在真实世界噪声测试集上进行更可靠的评估。此外,我们构建了一个包含 660 万个实例并带有多属性标签和披露元数据的大规模基准数据集。实验表明,\textsc{NORA} 在各种最先进的噪声标签基线(包括 Co-teaching、Mixup、SSR 和 SelfMix)方面表现优异。此外,\textsc{NORA} 在无过滤和噪声过滤测试设置下都表现出鲁棒性。在概念名称和时序关系预测方面,\textsc{NORA} 实现了最佳准确率、宏平均 F1 和加权 F1,而在规模和符号预测方面仍保持竞争力。这些结果表明,在考虑真实世界金融披露标签噪声的同时,联合建模丰富的 FNE 属性具有重要价值。
引用
@article{arxiv.2605.24910,
title = {Noise-Robust Financial Numerical Entity Attribute Tagging},
author = {Hsin-Min Lu and Chen-Yang Lai and Yi-Jhen Li and Ju-Chun Yen},
journal= {arXiv preprint arXiv:2605.24910},
year = {2026}
}