中文

文本与图像注释的替代表征推断 (Surrogate Representation Inference)

机器学习 2025-12-29 v2 应用统计

摘要

随着研究者越来越依赖机器学习模型和大型语言模型 (LLM) 来标注非结构化数据(如文本或图像),已提出 various (各种) 方法来纠正下游统计分析中的偏差。然而,现有方法往往导致较大的标准误差,且需要某些无错误的人类标注。在本文中,我引入替代表征推断 (SRI),该方法假设非结构化数据充当人类标注与结构化变量之间关系的完整中介器。只要人类标注者仅依赖非结构化数据进行标注,SRI 的假设就能得到保证。在此设置下,我提出了一种神经网络架构,通过学习非结构化数据的低维表征来确保 SRI 假设成立。在可获得多个人类标注的情况下,SRI 可进一步用于纠正可能存在于人类标注中的非微分测量误差。在关注文本作为结果情形时,我正式建立了 SRI 的识别条件和半参数高效估计策略,以实现学习和利用此低维表征。仿真研究和真实世界应用表明,当机器学习分类准确率适中时,SRI 可将标准误差降低 50% 以上,并在人类标注包含非微分测量误差时仍能提供有效推断。

关键词

引用

@article{arxiv.2509.12416,
  title  = {Surrogate Representation Inference for Text and Image Annotations},
  author = {Kentaro Nakamura},
  journal= {arXiv preprint arXiv:2509.12416},
  year   = {2025}
}