基于视觉文字特征证据深度回归的历史手稿概率断代
人工智能
2026-05-18 v1 计算机视觉与模式识别
摘要
我们引入了一种仅从视觉特征对历史手稿页面进行断代的概率方法。与先前文献中将世纪聚合为类别的标准做法不同,我们将断代视为连续年份轴上的证据深度回归问题,使得我们的神经网络能够在单次前向传播中输出完整的预测分布,并分解认知不确定性与偶然不确定性。我们的架构结合了 EfficientNet-B2 主干网络与 Normal-Inverse-Gamma (NIG) 输出头,采用联合负对数似然与证据正则化目标进行训练。在 DIVA-HisDB 基准(150 页,3 部中世纪抄本,151,936 个图像块)上,我们的模型测试 MAE 为 5.4 年,远低于 50 年的世纪标签监督粒度,其中 93% 的图像块误差在 5 年以内,97% 在 10 年以内。我们的方法在单次前向传播中实现了 \textbf{PICP=92.6\%},在所有对比方法中校准效果最佳,优于 MC Dropout(PICP=88.2\%,50 次传播)和 Deep Ensembles(PICP=79.7\%,5 个模型),且推理成本低 。不确定性分解表明,偶然不确定性是断代误差的强预测因子(Spearman ),对最确定的 20% 图像块进行选择性预测可提供 \textbf{0.5 年 MAE}。我们表明,随着图像退化加剧,预测的不确定性会增加;空间分解图解释了哪些文字区域导致了偶然不确定性;页面级聚合将 MAE 降至 4.5 年,且不确定性与页面级误差之间的 。
引用
@article{arxiv.2605.06475,
title = {Probabilistic Dating of Historical Manuscripts via Evidential Deep Regression on Visual Script Features},
author = {Ranjith Chodavarapu},
journal= {arXiv preprint arXiv:2605.06475},
year = {2026}
}