通过逆向工程 UNIX 时间戳从医学图像中提取可解释的日期
人工智能
2025-06-04 v2
摘要
日期通常对影响重大的医疗决策有贡献,但如何提取这些数据却很少明确。人工智能才刚刚开始被用于转录此类文档,常见的方法要么是信任复杂 AI 模型产生的输出,要么是使用正则表达式解析文本。最近的研究已经证实正则表达式是一种可解释的逻辑形式,但很难将其分解为构建精确 UNIX 时间戳所需的组成部分。首先,我们测试了公开可用的正则表达式,发现它们无法捕获我们大量的日期。接下来,我们手动创建了易于分解的正则表达式,发现它们能够检测到大多数真实日期,但也检测到许多看起来像日期的文本序列。最后,我们使用正则表达式合成,从我们创建的逆向工程 UNIX 时间戳中自动识别正则表达式。我们发现,通过正则表达式合成创建的正则表达式检测到的看起来像日期的文本序列远少于手动创建的,但代价是遗漏日期的数量略有增加。总的来说,我们的结果表明,可以通过正则表达式合成来创建正则表达式,以识别文本转录中的复杂日期和日期范围。据我们所知,我们提出的通过逆向工程多个多对一映射并将其输入正则表达式合成器来学习确定性逻辑的方法是一种新方法。
引用
@article{arxiv.2505.11451,
title = {Extracting Explainable Dates From Medical Images By Reverse-Engineering UNIX Timestamps},
author = {Lee Harris},
journal= {arXiv preprint arXiv:2505.11451},
year = {2025}
}
备注
This research was funded by a UKRI grant. Number: 10048265