中文

基于路径策略梯度的非占有型主动特征获取

机器学习 2026-05-08 v1 机器学习

摘要

主动特征获取 (AFA) 考虑到特征获取成本较高的问题,学习者自适应地决定为每个实例获取哪些特征值以及何时停止并进行预测。AFA 可建模为部分可观测马尔可夫决策过程 (POMDP),这为序列决策视角提供了自然的建模方式。本文提出了非占有型路径策略梯度 (NM-PPG),一种基于该建模的新型 AFA 方法。我们引入了获取过程的连续松弛,使其能够通过完整获取轨迹实现路径梯度,避免标准评分函数策略梯度的高方差,同时允许对非占有型获取策略进行端到端优化。为更好地将训练与部署对齐,我们进一步开发了直通滚动方案,在前向传播中遵循硬特征获取,在反向传播中通过相应的软松弛进行梯度传播。我们通过熵正则化和阶段性温度锐化来稳定优化。在合成数据和真实数据集上的实验表明,NM-PPG 相对于最先进的 AFA 基线方法具有更优性能。

关键词

引用

@article{arxiv.2605.05511,
  title  = {Non-Myopic Active Feature Acquisition via Pathwise Policy Gradients},
  author = {Linus Aronsson and Morteza Haghir Chehreghani},
  journal= {arXiv preprint arXiv:2605.05511},
  year   = {2026}
}