提高段落披露完整性与可比性:基于大型语言模型的方法
计算与语言
2026-05-26 v1 信息检索
综合金融
摘要
段落级别披露是财务报告的核心组成部分,提供有关企业内部组织以及经济活动在不同运营单位之间分配的见解。然而,段落信息常以定性和定量两种形式呈现,分别分散在Form 10-K filing 的表格和叙述章节中。依赖结构化数据库的实证研究面临完整性和可比性挑战,因为某些 firm-year observations 可能缺失,嵌套段落披露未被捕获,支持纵向和跨企业可比性的支持有限。本研究构建了基于大型语言模型的框架,从Form 10-K filing 中直接提取段落披露,并保留 reportable 和嵌套段落信息。我们进一步设计了检索增强系统,整合多个 filing 间的信息以支持可比性。我们使用两个典型场景来演示其应用:对单个企业内部进行纵向分析以解释段落随时间的变化,以及跨企业对齐不同报告结构下的地理段落。结果表明,该artifact准确提取段落级别信息,有效解决需要跨期知识的问题,展示了LLM方法在提升段落披露测量和解释方面的潜力。
引用
@article{arxiv.2605.23924,
title = {Improving the Completeness and Comparability of Segment Disclosures: A Large Language Model Approach},
author = {Yue Liu and Zhiyuan Cheng and Longying Lai},
journal= {arXiv preprint arXiv:2605.23924},
year = {2026}
}
备注
39 pages, 4 figures, submitted to Accounting Horizons