GelSight Mini · 胶垫与磨损变异

方法

一个统计量衡量信号移动多远,一套协议衡量代价多大。下面这两个测量 决策对答案的影响,比任何建模选择都大。

外观统计量

两张无接触平均帧之间的 uint8 均方根像素差,内缩 12 px,外加逐通道 中位数。事先定死,以免看到答案后再回头调参。

先算噪声底 —— 在你知道同一个格子的两次平均会给出多少之前, 两张平均图之间的距离是没有意义的。把每格 100 次重复拆成互不相交的两半: 总 1.43 / 低频 0.28。

决策一 —— 跨数据集时,只有低频部分可比

「缩放到统一几何后比总 RMS」这个做法是错的,而且在产出任何结果之前就被证伪了: 一次重采样往返会把白噪声级的差异衰减 约 40 %(7.88→4.71),而低频差异的 不变性达到 1e-4。只有当磨损纯粹是照明漂移时这才无害 —— 实测它是 48 % 低频 / 41 % 高频。所以 rms 只在单个数据集内部用,rms_lowfreq 才跨数据集用。一个回归测试把这条钉住。

The two axes are physically different: units differ in illumination (low-frequency, global
两条轴的物理性质不同:不同整机差在照明(低频、全局),不同胶垫差在标记点排布与纹理(高频、局部)。后果是:任何跨数据集比较都会系统性低估胶垫轴。 gel_axis.json → low_frac

决策二 —— 趋势只在连续采集段内部拟合

这次采集横跨四天,中间有长达 88 小时的停顿,而外观恰好在这些边界上跳变 —— 跨越停顿去拟合趋势,量到的是重新装夹。所以在拟合任何斜率之前,先按采集间断把记录切段; 段内漂移则对照置换零假设打分,因为段基线本身包含了被评分的帧,即使零漂移 Spearman 也会为正。

打分协议

用一个共享打分器算秩相关,每次运行都做自检(单调信号 >0.9,打乱后 <0.5)。 迁移一律显式地「在源域拟合、到目标域评分」,并配一个同等拟合规模的域内对照。 编码器比较先把所有特征投到统一宽度(PCA 只在源域拟合),并给出 k = 32…256 的 扫描 —— 没有这一步,比较排的是输出宽度而不是表示质量。

经独立审查后撤回的结论

两个对抗性审查 agent 对着代码与原始数据复核了每一个数字,四条头条结论没能活下来。 保留在此,是因为一个只展示成功结果的页面不构成证据。

撤回的结论失败原因
The encoder ranking reflected representation quality 它排的是特征宽度。打分器在 p ≈ n_fit 处行为质变;固定特征类型、只改宽度, 迁移 rho 就从 +0.04 荡到 +0.91,而旧表恰好按宽度单调。
“7/7 wear segments positive, p ≈ 0.008” 零假设并不以 0 为中心 —— 基线里含有被评分的帧。改用置换零假设后, 7 段里只剩 3 段显著。
Gel axis = 16.35 FEATS 的 gel 序号 5 是无标记胶垫,所以三分之一的配对其实是换胶垫 型号。更正为 13.03, 换型号那一项单独报告为 27.19。
Shift-predicts-cost at p = 0.0033 12 个有向对其实只含 6 个不同的漂移值。Mantel 置换给出 p=0.083。
更早的撤回,以及带数字被否掉的想法

Sparsh 的 batch 顺序。早先的计划把 sphere/batch_1..6 当作 连续磨损轴。39 个 pickle 的 mtime 全部落在同一个 2 分钟的下载窗口内;盘上没有任何 东西能说明这个索引是时间顺序。只能当作无序分组使用。

「25 小时磨损 ≈ 换一次胶垫」。这是一个无效的跨分辨率比较 (640×480 对 240×320,而磨损有 41 % 在高频)。撤回。

用随机帧估背景色。会被接触污染:在同一个目录内,描述子从最低力帧到最高力帧 移动 3.35 RMS,与它自己产出的「簇间分离」同量级。改用数据集自带的 656 张真正无接触帧后, 目录内的离散度降到 0.017。

破损严重度。两个判据(频谱构成与空间集中度)在两次实验上互相矛盾,而且 这里没有任何数据集带破损标注。因此不下「破损」结论。

数据来源
来源n可获取性作用
FEATS no-contact grid3,000public 5 台 × 6 块胶垫 × 100 次重复,完全交叉且平衡
FEATS transfer splits393 / 395public 数据集自带的「换传感器+换胶垫」漂移,两侧都有力标签
Gel durability campaign464 refs in-house, unreleased 单台 Mini 上累计夹持 25.0 小时;结论 1 完全依赖它
cnc_mini_2614,722in-house, unreleased markerless, force in filename
FeelAnyForce13,589public markerless, 6-axis wrench
TacQuad (Mini only)24,866public 跨域;无力标签,只有接触窗口标注

六个来源中有两个是实验室内部采集,没有 README、没有许可证、也未发布,因此结论 1 和结论 4 目前无法仅凭公开数据复现。凡是取自它们的图,都标明了具体目录。

本站术语
分布外 (OOD)
out-of-distribution (OOD)
与估计器拟合时所见不同的输入 —— 这里指:换了传感器、换了胶垫、或换了数据集。
参考帧
reference frame
胶垫上没有任何东西按压时拍的图。重建算的是「当前帧与参考帧之差」,所以参考帧承载了这台传感器自身的照明特性。
有标记 / 无标记胶垫
markered / markerless gel
GelSight 的胶垫要么印有一格黑点阵(用来读切向力),要么没有。这个差别对图像的影响,远大于换一块同款胶垫。
rms / rms_lowfreq
rms / rms_lowfreq
两张平均图之间的均方根像素差,单位 0–255。rms_lowfreq 只保留平滑部分 —— 这是唯一能跨不同分辨率比较而不失真的版本。
噪声底
noise floor
什么都没变时这个统计量读到的值:同一台、同一块垫的两次平均。比它小的效应测不出来。
Spearman 秩相关 rho
Spearman rho
秩相关系数,−1…1。它问的是预测有没有把真实力值排对顺序,与尺度无关 ——所以能跨力单位不同的数据集使用。
域内 vs 迁移
in-domain vs transfer
域内:在同一群体上拟合并评分。迁移:在一个群体上拟合,到另一个上评分。两者之差就是这次分布漂移的代价。
置换零假设
permutation null
把数据打乱后,同一套流程会给出的分数。没有它,一个正相关可能只是流程本身必然产生的,却被当成有意义。
Mantel 置换检验
Mantel permutation
用于「距离对距离」比较的显著性检验 —— 这类观测共享群体因而并不独立。它重排的是群体标签,而不是观测本身。
LUT vs 免标定
LUT vs calibration-free
把图像转成表面深度的两种做法。LUT(查找表)是逐传感器用已知按压标定出来的,免标定解不是 —— 这就是换传感器时两者退化方式不同的原因。
退化迁移
degenerate transfer
拟合出的映射把目标域每个样本都送到同一个值,秩相关无定义 —— 这是彻底失效,不是缺测。