从模糊到行动:关于部分多标签模糊及其时域一步解析的 POMDP 视角
机器学习
2026-02-05 v1
摘要
在部分多标签学习 (PML) 中,真实标签是不可观测的,这使得标签消歧非常重要但也十分困难。一个关键挑战是,模糊的候选标签可能会传播错误到下游任务,如特征工程中。为解决此问题,我们将消歧和特征选择任务联合建模为部分可观测马尔可夫决策过程 (POMDP),将 PML 风险最小化转化为期望收益最大化。阶段 1 通过强化学习训练一个变压器策略,以生成高质量的硬伪标签;阶段 2 将特征选择描述为顺序强化学习问题,逐步选择特征并输出可解释的全局排序。我们进一步提供了 PML-POMDP 对应关系的理论分析以及分解误差的剩余风险界,后者将误差分解为伪标签质量项和样本量项。实验在多个指标和数据集上验证了该框架的优势。
引用
@article{arxiv.2602.04255,
title = {From Ambiguity to Action: A POMDP Perspective on Partial Multi-Label Ambiguity and Its Horizon-One Resolution},
author = {Hanlin Pan and Yuhao Tang and Wanfu Gao},
journal= {arXiv preprint arXiv:2602.04255},
year = {2026}
}