面向屏幕条件动作预测的体系结构敏感监督微调基准:PiSAR基准
人工智能
2026-05-29 v1 计算与语言
人机交互
摘要
我们在PiSAR(Persona, intent, Screen, Action, Rationale)的一个661行持留存切片上,对三个监督微调模型与前沿零shot基线进行基准测试。该基准包含来自公开应用商店评论、Pew American Trends Panel人口学特征和OPeRA购物轨迹所筛选的12,929个屏幕锚定行为理由。每个模型,无论是前沿还是微调,都在相同的661行切片上以相同的评分管道进行评估。我们的两个发现:第一,前沿零shot基线(Claude Opus 4.7和GPT-5.5)分别达到sem_sim 0.459和0.482;经过微调的Qwen3-VL-8B-Instruct达到0.783,在79%的行上实现sem_sim >= 0.7,而两个前沿基线仅为1-2%,在相同的测试集上实现了0.30的绝对差距。第二,在相同的训练数据和配方下,Gemma-4-26B-A4B-IT仅得分0.441,与前沿零shot基线处于同一水平,而非与微调的Qwen。我们将此解读为配方与模型之间的不匹配:推理调优的高参数模型抗拒置换,可能需要更多数据或更强的微调方法才能实现此目标。
引用
@article{arxiv.2605.29400,
title = {Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark},
author = {Rahul Bissa and Abhishek Vyas and Yash Jain},
journal= {arXiv preprint arXiv:2605.29400},
year = {2026}
}
备注
14 pages, 7 figures, 2 tables. PiSAR corpus and fine-tuned weights are proprietary to AprioriLabs; methodology and recipe released