融合奖励最大化与总体估计:面向美国国税局审计选择的序贯决策
机器学习
2023-01-25 v3 计算机与社会
摘要
我们引入了一种新的设定——优化与估计结构化赌博机(optimize-and-estimate structured bandits)。在此设定中,一个策略必须选择一批臂(arms),每个臂由其自身的上下文刻画,使得该策略既能最大化奖励,又能维持对奖励总体(理想情况下无偏)的准确估计。这一设定内在地存在于许多公共和私营部门应用中,且常需处理延迟反馈、小样本和数据分布偏移。我们基于美国国税局(IRS)的真实数据展示了其重要性。IRS每年对税基进行审计。其两个最重要的目标是识别疑似错报以及估计“税收缺口”——已缴金额与真实应缴金额之间的全局差额。基于与IRS的独特合作,我们将这两个过程构建为一个统一的优化与估计结构化赌博机。我们分析了针对IRS问题的优化与估计方法,并提出了一种新颖的无偏总体估计机制,其获得的奖励与基线方法相当。该方法有望在保持政策相关的税收缺口估计的同时,提升审计效能。鉴于当前税收缺口估计接近五千亿美元,这具有重要的社会影响。我们指出该问题设定是进一步研究的肥沃土壤,并强调其有趣的挑战。此项及相关研究的成果正被纳入IRS审计选择方法的持续改进中。
引用
@article{arxiv.2204.11910,
title = {Integrating Reward Maximization and Population Estimation: Sequential Decision-Making for Internal Revenue Service Audit Selection},
author = {Peter Henderson and Ben Chugg and Brandon Anderson and Kristen Altenburger and Alex Turk and John Guyton and Jacob Goldin and Daniel E. Ho},
journal= {arXiv preprint arXiv:2204.11910},
year = {2023}
}
备注
Accepted to the Thirty-Seventh AAAI Conference On Artificial Intelligence (AAAI), 2023