中文

你的神经网络是否会外推?特征工程作为可识别偏置的 OOD 泛化

机器学习 2026-05-14 v2 人工智能

摘要

成功的深度神经网络发现数据的显著特征。我们展示了它们何时何地失败于从训练窗口内的分布学习 OOD 相关表征。这需要将特征学习从数据生成过程(DGP)的可识别性中解耦。从单个训练窗口,OOD 外推是不可识别的:无限多的 DGP 在训练数据上是 ε\varepsilon 观察等价的,但在训练之外会任意地发生分歧,仅凭训练分布标准无法可靠地解决这一谜题。结构性承诺——特征图、标签图和模型类 (φ,ψ,M)(\varphi, \psi, \mathcal{M})——决定了假设的 DGP 并支配 OOD 泛化,同时使 ID 性能基本保持不变。当架构、预训练、数据增强、输入格式或领域知识隐式地注入缺失的承诺时,模型会成功。当它无法从 ID 证据推断 OOD 相关结构时,它会失败。仅改变表征,即可使相同架构在相同的 ID 损失下, OOD 差异可达 520×{\sim}520\times。当承诺正确且可识别时,OOD 误差消失。例如,傅里叶坐标将周期性外推转化为在 S1\mathbb{S}^1 上的插值。该同一机制预测了在三种自然科学情境中的结果(质量作用化学;Kepler 第三定律的系外行星预测,n=2,362n=2{,}362;以及跨种系 DNA 检测),以及在 Transformer、Mamba 和 S4D 上的 264 次位置编码研究中。最后,一个受控研究表明:正确的特征是必要的但不充分的。模型类必须能够表达目标,转换后的训练数据必须覆盖相关表征空间。

关键词

引用

@article{arxiv.2605.07483,
  title  = {Does Your Neural Network Extrapolate? Feature Engineering as Identifiability Bias for OOD Generalization},
  author = {Leonel Aguilar and Jan Nagler and Christoph Hoelscher and Nino Antulov-Fantulin},
  journal= {arXiv preprint arXiv:2605.07483},
  year   = {2026}
}