GelSight Mini · 胶垫与磨损变异

结果

磨损:25 小时夹持,无可检测效应

Appearance of the no-contact reference frames against cumulative gripping time. The entire
无接触参考帧的外观随累计夹持时间的变化。整个台阶恰好与一次 88 小时的采集中断重合;此后曲线平到噪声底以内。 wear_trend.json → ted_gel.series

在连续采集段内部 —— 这是唯一能把斜率归因于「使用」的地方 —— 7 段里只有 3 段超过置换零假设, 而且多数段的增量落在自身噪声底以下。这个漂移不跨段累积,所以它是每段会复位的 可逆效应,不是磨损。LED 热身是最自然的候选,但本数据无法把它与环境温度或胶垫蠕变 区分开,因此不作声称。

换成公开数据还成立吗?

结论 1 依赖的是一次实验室内部采集,单靠它只能说明那一套装置,而不是 GelSight Mini 这类传感器。所以另查了两个公开数据集,只用它们自己的参考帧, 不借用那套装置的任何数据。

Ten public Sparsh sessions, advanced together. Sparsh has no clock, but each rec
十个公开的 Sparsh session 同步推进。Sparsh 没有时钟,但每次录制本身是有序序列并带 in_contact 标志,所以它的非接触帧不需要时钟也能构成会话内的时间轴。九格纹丝不动,红框那一格在变。 Sparsh / TacBench · WebP 40 kB, GIF fallback 625 kB
The same ten sessions as |last minus first|, amplified 10x because the real drif
同样这十个 session 的「末帧减首帧」绝对差,放大 10 倍 —— 因为真实漂移很小:2.94 RMS,噪声底 0.44。九格近乎全黑,一格发亮。放大倍数对每一格都相同,所以格与格之间的差别不是放大造成的。 Sparsh / TacBench · 23 kB
FoTa, one finger, eleven capture days across 33, with the date burned in. Watch
FoTa,同一根手指,33 天内的十一个采集日,日期烧在画面上。注意第 1 天到第 21 天之间的跳变:这两天之间隔的是一次采集空档,不是二十天的使用。再看它之后那九天动得多小。 FoTa_labeled, left finger only · WebP 27 kB, GIF fallback 224 kB
Left: Sparsh has no timestamps, but each recording is a sequence and ships an in_contact f
左:Sparsh 没有时间戳,但每次录制本身是有序序列,且带有 in_contact 标志,所以它的非接触帧构成了一条会话内的时间轴。十个公开 session 中有一个漂移超过噪声底,九个没有。右:FoTa 的文件名带真实采集时间戳,给出同一根手指跨越 33 天的记录。 Sparsh / TacBench, FoTa_labeled

两者都复现了内部数据的形态。Sparsh:10 个 session 里有 1 个漂移超过噪声底 (6.6 倍),其余九个都在 0.8–1.3 倍 —— 与耐久性实验里「7 段中 3 段显著」的异质性一致。 FoTa:外观在一次 20 天的采集空档处出现台阶,此后的十二个采集日里几乎不动,而这个台阶的 大小约等于同一天换到另一根手指(9.8 RMS)。两个数据集都支持磨损随使用累积, 但都支持「装置被扰动时外观会移动」。

亲眼看它发生

拖动滑块。红色刻度是采集中断,不是夹持时间的刻度。图像在刻度处跳变, 在两个刻度之间的几小时里几乎不动。

无标记胶垫 —— 5.3 小时。公开的带力标签 Mini 数据多数用无标记垫, 所以先看这一组。

0824_durability wear time-lapse
同一组数据的循环动画,40 帧,累计夹持时间已烧进画面,所以这张图被复制出本页后仍然自带时间轴。以 WebP 提供(96 kB);GIF 回退版(835 kB)体积更大且会出现等高线色环 —— 256 色装不下胶垫上的平滑渐变。 panda_durability_test_data/0824_durability

有标记胶垫 —— 25.0 小时,更长的一组。它那 15 RMS 的台阶压在 88 小时中断上; 而上面那组无标记数据,在它第二段内部出现了真实的上升。两组对「使用中到底有多少 漂移」并不一致,所以谁都不单独呈现。

ted_gel wear time-lapse
同一组数据的循环动画,60 帧,累计夹持时间已烧进画面,所以这张图被复制出本页后仍然自带时间轴。以 WebP 提供(247 kB);GIF 回退版(1285 kB)体积更大且会出现等高线色环 —— 256 色装不下胶垫上的平滑渐变。 panda_durability_test_data/ted_gel
逐段表(n = 7 / 8;有一段只含 1 帧, 已排除)
时长 hn ΔΔ/floorrho 置换 p超过零假设
03.39640.86+0.21+0.25×+0.2480.085
15.901120.85+0.21+0.25×+0.2280.020yes
21.00201.14+0.38+0.33×+0.3470.340
43.31631.14+0.19+0.16×+0.1550.215
55.901121.06+1.54+1.45×+0.6990.000yes
63.94750.76+0.75+0.98×+0.5280.000yes
70.84172.10+0.24+0.12×+0.2060.545

参考帧本身就是那个适配

FEATS new_gel
拖动分隔线。两侧是同一个压头、同样的受力,只有传感器和它的胶垫不同。结论 2 和 3 就是在这一次漂移上测出来的。 FEATS test_diff_sensor_old_gel / _new_gel · cylinder_8 at 12.19 N vs 12.19 N
The same sensor+gel shift, scored two ways. Re-estimating the reference on the target doma
同一次「换传感器+换胶垫」漂移,用两种方式打分。在目标域重新估计参考帧(不需要力标签)代价是 1.5–5.5 %;沿用源域参考帧则在四个条件里有三个代价 70–95 %。 shift_vs_cost.json

换胶垫或换传感器之后,一定要重新采集参考帧。这一步是无监督的,能把损失 基本全部收回;省掉它,基于物理的力估计就不工作了。

本页早前版本报告过一个不符合规律的条件 —— 免标定的 new→old 在零样本下 仍有 0.93 —— 并把它标为无法解释。那是个伪影:FEATS 的帧以 RGB 存储,却被按 BGR 读取, 于是那次比较测的是通道交换而不是换传感器。通道修正后它与其余三个条件一致 (0.10)。 全文的漂移样本量 n = 1。

冻结编码器:在统一特征宽度下比较

Left: transfer under a sensor+gel change, both directions, after PCA to a common width. Ri
左:投到统一宽度后,换传感器+胶垫的双向迁移。右:同一比较在不同宽度下的表现 —— 预训练编码器是平的,微调过的 T3 checkpoint 不是。 encoder_gap.json

这些编码器到底是干什么的?

这里没有训练任何网络。每个编码器都是一个冻结的特征提取器:输入一张触觉图, 输出一个定长向量,只有「向量 → 力」这一小段线性映射是拟合出来的。问题不是「哪个模型的 触觉感知最强」—— 它们在训练时谁都没见过触觉图。问题更窄也更有用:面对换传感器, 一个通用视觉表示是否比物理重建管线更扛得住?

四个都是普通的计算机视觉骨干网络,公开且冻结,覆盖两种预训练范式: ResNet50/18 来自 ImageNet 有监督分类,DINOv2 ViT-B/S 来自无标签的自监督 训练。它们就是别人真会随手拿来用的那些编码器。另有两个参照锚定这个比较。 32×32 原始像素对照完全没有学到的表示,标出任何编码器必须超过的下限; T3 checkpoint 则是这里唯一一个触觉专用模型。

这张表要这样读:每一行的拟合与打分方式完全相同,所以行与行之间的差异是表示 的差异,不是方法的差异。六种特征的域内 rho 都挤在一个很窄的带里,迁移却不是 —— 所以域内 分数在这里对鲁棒性没有任何说明力。T3 那一行最差,但它是一个下游微调的 checkpoint、由张量 反推重建,且宽度扫描不稳定;这不构成对 T3 方法的评价。

外观漂移能预测代价吗?

cnc_mini_26 triangle
同一个三角压头、同样的受力,分别压在有标记和无标记的胶垫上。分隔线两侧剩下的差别就是胶垫型号,它在外观上值 11.9–23.5,并且会让迁移崩溃。 FEATS / cnc_mini_26 · triangle_8 at 7.92 N vs 7.93 N
cnc_mini_26 round
第二组,圆形压头,同样处理。点阵不是叠在信号之上的细节 —— 它主导了估计器读到的整张图。 FEATS / cnc_mini_26 · sphere_10 at 12.84 N vs 12.82 N
The four force-labelled populations, cycled. Watch the dot lattice appear and va
四个带力标签的群体轮播。注意点阵的出现与消失。那条边界值 11.9–23.5 rms_lowfreq,但这里最大的间隙 24.3 出现在两个无标记数据集之间 —— 区分数据集的不只是标记点。 FEATS, cnc_mini_26, FeelAnyForce · 4 frames · WebP 19 kB, GIF fallback 99 kB
Transfer against appearance shift over four force-labelled Mini populations. Crosses are d
四个带力标签的 Mini 群体上,迁移对外观漂移的关系。叉号是退化迁移(常数预测),记为 0 并标记,而不是丢弃。 cross_dataset_gap.json
全部 12 个有向对(其中只有 6 个是独立漂移)
迁移对漂移ResNet50 原始像素
feats_old->feats_new5.10+0.968+0.790
feats_old->cnc2611.87+0.358+0.060
feats_old->faf23.47+0.252-0.442
feats_new->feats_old5.10+0.838+0.809
feats_new->cnc2612.70+0.414+0.070
feats_new->faf21.96+0.095-0.113
cnc26->feats_old11.87-0.240+0.000*
cnc26->feats_new12.70-0.071+0.000*
cnc26->faf24.27+0.076+0.791
faf->feats_old23.47-0.641+0.924
faf->feats_new21.96-0.588+0.806
faf->cnc2624.27+0.013+0.742

* 退化:拟合出的映射把目标域每个样本都送到同一个值,Spearman 无定义。 记为 0 并标记 —— 直接丢弃会让汇总偏向那些恰好跑通的对。注意 0 并不是观测到的最差值 (迁移最低到 -0.64), 所以这个填补并不中性。

用背景色反推未标注的采集状态

这里没有任何数据集把力样本按传感器或胶垫标注。背景色由 LED 与胶垫决定,而不是由 被按压的物体决定 —— 所以它能反推出这个缺失的状态,但前提是只在无接触的帧上测量。 在数据集自带的 19 个目录的真无接触帧上, 目录内离散度降到 0.017, 而簇间分离是 5.93 —— 相差 340 倍。

方法簇内跨物体 跨簇(重估参考)跨簇(零样本)
LUT+0.456 -0.268 +0.334
免标定 +0.915 +0.918 +0.938

免标定重建不受影响;逐传感器标定的 LUT 则退化 —— 这正是本任务立项要检验的预测。 但较小的那个簇只含两个目录,力的直方图也没完全匹配,而且LUT 重估参考后的分数反而比 零样本更差,这在物理上说不通,至今没有解释

本站术语
分布外 (OOD)
out-of-distribution (OOD)
与估计器拟合时所见不同的输入 —— 这里指:换了传感器、换了胶垫、或换了数据集。
参考帧
reference frame
胶垫上没有任何东西按压时拍的图。重建算的是「当前帧与参考帧之差」,所以参考帧承载了这台传感器自身的照明特性。
有标记 / 无标记胶垫
markered / markerless gel
GelSight 的胶垫要么印有一格黑点阵(用来读切向力),要么没有。这个差别对图像的影响,远大于换一块同款胶垫。
rms / rms_lowfreq
rms / rms_lowfreq
两张平均图之间的均方根像素差,单位 0–255。rms_lowfreq 只保留平滑部分 —— 这是唯一能跨不同分辨率比较而不失真的版本。
噪声底
noise floor
什么都没变时这个统计量读到的值:同一台、同一块垫的两次平均。比它小的效应测不出来。
Spearman 秩相关 rho
Spearman rho
秩相关系数,−1…1。它问的是预测有没有把真实力值排对顺序,与尺度无关 ——所以能跨力单位不同的数据集使用。
域内 vs 迁移
in-domain vs transfer
域内:在同一群体上拟合并评分。迁移:在一个群体上拟合,到另一个上评分。两者之差就是这次分布漂移的代价。
置换零假设
permutation null
把数据打乱后,同一套流程会给出的分数。没有它,一个正相关可能只是流程本身必然产生的,却被当成有意义。
Mantel 置换检验
Mantel permutation
用于「距离对距离」比较的显著性检验 —— 这类观测共享群体因而并不独立。它重排的是群体标签,而不是观测本身。
LUT vs 免标定
LUT vs calibration-free
把图像转成表面深度的两种做法。LUT(查找表)是逐传感器用已知按压标定出来的,免标定解不是 —— 这就是换传感器时两者退化方式不同的原因。
退化迁移
degenerate transfer
拟合出的映射把目标域每个样本都送到同一个值,秩相关无定义 —— 这是彻底失效,不是缺测。