基于动态探索图分析的 LLM 嵌入空间优化:蒙特卡罗研究
机器学习
2026-01-27 v1 应用统计
摘要
大型语言模型(LLM)嵌入日益用于在数据收集前估算心理项目池的维数结构,但当前应用将嵌入视为静态、横截面表示,隐含假设所有嵌入坐标贡献均等,忽视了最优结构信息可能集中在嵌入空间特定区域的可能性。本研究重新框构嵌入为可搜索的景观,适应动态探索图分析(DynEGA),将维度指数作为类时间顺序来遍历嵌入坐标,类似于强纵向轨迹。使用 OpenAI 的 text-embedding-3-small 模型,对代表五个神经自大 narcissism 维度的项目嵌入进行大规模蒙特卡罗模拟,生成在项目池大小(每个维度 3-40 项)和嵌入深度(3-1,298 维)系统变化下的网络估计。结果表明,总熵适配指数(TEFI)和归一化互信息(NMI)在嵌入景观中引导不同的优化轨迹。TEFI 在深层嵌入范围(900--1,200 维)实现最小值,此处熵组织最大,但结构精度下降;而 NMI 在浅层深度处达到峰值,此时维数恢复最强,但熵适配性仍不理想。单一指标优化产生结构不连贯的解决方案,而加权复合准则识别在准确性和组织性之间实现平衡的嵌入维度深度区域。最佳嵌入深度随项目池大小系统性地进行比例缩放。这些发现确立了嵌入景观作为非均匀语义空间的事实,要求原则性优化而非默认使用完整向量。
引用
@article{arxiv.2601.17010,
title = {Optimizing the Landscape of LLM Embeddings with Dynamic Exploratory Graph Analysis for Generative Psychometrics: A Monte Carlo Study},
author = {Hudson Golino},
journal= {arXiv preprint arXiv:2601.17010},
year = {2026}
}
备注
18 pages, 6 figures, conference paper