GRAB:基于风险分类学的无监督主题发现基准
计算与语言
2026-05-20 v2
摘要
10-K 文件中的风险分类对监管和投资至关重要,但目前尚无公开基准用于评估无监督主题模型在此任务上的表现。我们提出 GRAB,一个专为金融领域设计的基准数据集,包含 1.61M 句子,来自 8,247 份文件,并通过结合 FinBERT token attention、YAKE 关键词信号和 taxonomy-aware collocation matching 而无需人工标注地生成句子级别标签。标签基于将 193 个术语映射到 21 个细粒度类型的风险分类学,后者嵌套在五个宏观类别下;21 个细类型指导弱监督,而评估在宏观层面进行。GRAB 统一了固定数据集划分和稳健指标——准确率、宏观 F1、Topic BERTScore 和基于熵的 Effective Number of Topics。该数据集、标签和代码使经典模型、嵌入式模型、神经网络模型和混合模型在金融披露文件上的主题模型进行可重复、标准化的比较成为可能。
引用
@article{arxiv.2509.21698,
title = {GRAB: A Risk Taxonomy--Grounded Benchmark for Unsupervised Topic Discovery in Financial Disclosures},
author = {Ying Li and Tiejun Ma},
journal= {arXiv preprint arXiv:2509.21698},
year = {2026}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Generative AI in Finance