中文

利用语义相似性进行AI生成处理的实验

统计方法学 2025-10-27 v1 机器学习

摘要

大型语言模型(LLM)使得能够以日益复杂的方式将人类与模型生成内容组合的新型数字实验成为可能。在此情境下,主要方法学挑战在于在不损失语义含义或使分析难以处理的情况下,代表这些高维处理。本文聚焦于学习捕获此类处理底层结构的低维表示。这些表示可用于指导生成模型产生有意义的处理变体,以及促进在线实验中的自适应分配。我们提出了双核表示学习方法,通过处理和用户协变量的核基表示内积来建模处理效应。我们开发了一种交替最小化算法,从数据中高效学习这些表示,并在低秩因子模型下提供收敛保证。作为本框架的应用,我们引入了一种用于在线实验的自适应设计策略,并通过数值实验展示了该方法的有效性。

关键词

引用

@article{arxiv.2510.21119,
  title  = {Leveraging semantic similarity for experimentation with AI-generated treatments},
  author = {Lei Shi and David Arbour and Raghavendra Addanki and Ritwik Sinha and Avi Feller},
  journal= {arXiv preprint arXiv:2510.21119},
  year   = {2025}
}

备注

31 pages, 5 figures