中文

基于视觉文字特征证据深度回归的历史手稿概率断代

人工智能 2026-05-18 v1 计算机视觉与模式识别

摘要

我们引入了一种仅从视觉特征对历史手稿页面进行断代的概率方法。与先前文献中将世纪聚合为类别的标准做法不同,我们将断代视为连续年份轴上的证据深度回归问题,使得我们的神经网络能够在单次前向传播中输出完整的预测分布,并分解认知不确定性与偶然不确定性。我们的架构结合了 EfficientNet-B2 主干网络与 Normal-Inverse-Gamma (NIG) 输出头,采用联合负对数似然与证据正则化目标进行训练。在 DIVA-HisDB 基准(150 页,3 部中世纪抄本,151,936 个图像块)上,我们的模型测试 MAE 为 5.4 年,远低于 50 年的世纪标签监督粒度,其中 93% 的图像块误差在 5 年以内,97% 在 10 年以内。我们的方法在单次前向传播中实现了 \textbf{PICP=92.6\%},在所有对比方法中校准效果最佳,优于 MC Dropout(PICP=88.2\%,50 次传播)和 Deep Ensembles(PICP=79.7\%,5 个模型),且推理成本低 5×5\times。不确定性分解表明,偶然不确定性是断代误差的强预测因子(Spearman ρ=0.729\rho=0.729),对最确定的 20% 图像块进行选择性预测可提供 \textbf{0.5 年 MAE}。我们表明,随着图像退化加剧,预测的不确定性会增加;空间分解图解释了哪些文字区域导致了偶然不确定性;页面级聚合将 MAE 降至 4.5 年,且不确定性与页面级误差之间的 ρ=0.905\rho=0.905

关键词

引用

@article{arxiv.2605.06475,
  title  = {Probabilistic Dating of Historical Manuscripts via Evidential Deep Regression on Visual Script Features},
  author = {Ranjith Chodavarapu},
  journal= {arXiv preprint arXiv:2605.06475},
  year   = {2026}
}