基于学习的数据录入表单完整性需求松弛方法
软件工程
2024-08-20 v3
摘要
数据录入表单使用完整性需求来指定从不同类型用户收集必要信息时所必需或可选填写的字段。然而,某些必填字段对于特定类型的用户可能不再适用。尽管如此,它们在表单中仍可能被错误地标记为必填;我们称此类字段为过时必填字段。由于过时必填字段在提交表单前通常具有非空校验,用户不得不在这类字段中填入无意义的值以完成表单提交。这些无意义的值威胁了所填数据的质量。为避免用户填写无意义的值,现有技术通常依赖人工编写的规则来识别过时必填字段并松弛其完整性需求。然而,这些技术低效且成本高昂。在本文中,我们提出 LACQUER,一种基于学习的自动化方法,用于松弛数据录入表单的完整性需求。LACQUER 构建贝叶斯网络模型,自动学习用户不得不填写无意义值的条件。为提升其学习能力,LACQUER 识别必填字段仅对一小部分用户适用的情况,并使用 SMOTE(一种过采样技术)在这类字段上生成更多实例,以有效挖掘其上的依赖关系。我们的实验结果表明,LACQUER 能够准确地松弛数据录入表单中必填字段的完整性需求,在不同数据集上的精确率介于 0.76 与 0.90 之间。LACQUER 能阻止用户填写 20% 至 64% 的无意义值,其负预测值介于 0.72 与 0.91 之间。此外,LACQUER 高效;它预测一个实例的完整性需求最多耗时 839 ms。
引用
@article{arxiv.2311.13517,
title = {Learning-Based Relaxation of Completeness Requirements for Data Entry Forms},
author = {Hichem Belgacem and Xiaochen Li and Domenico Bianculli and Lionel C. Briand},
journal= {arXiv preprint arXiv:2311.13517},
year = {2024}
}
备注
Accepted for publication by ACM Transactions on Software Engineering and Methodology