INT8 Adapter
74.7% ↓
适配器文件体积缩小
FP32 2.006 MiB → INT8 0.507 MiB。该数字仅指适配器文件,不包含 CLIP 主干。
查看量化实验 ↗01 / Overview
手术视频 × 视觉语言
SurgClip 研究如何利用轻量领域适配,让手术关键帧与阶段文本建立更有效的对应关系。
手术视频中,相邻阶段可能呈现相似的器械、组织和操作,细微的视觉差异增加了文本匹配的难度。SurgClip 在 CLIP 特征之上训练轻量阶段适配器,以基础模型作为对照,检验领域信息对匹配表现的影响。
我的工作贯通视频抽帧、标注索引、适配器训练、检索评估与结果可视化,并将领域适配、INT8 量化和 PQ 向量压缩分别纳入对照实验,区分匹配质量、存储收益与运行开销。
对照基础 CLIP 与阶段适配模型的关键帧—文本排序,结合总体指标与阶段表现分析适配效果,将结论与具体评估范围对应起来。
分别考察适配器文件体积、向量存储、匹配效果与运行延迟,避免将更小的模型文件直接等同于更快的系统。
02 / Approach
从视频数据到可量化的检索结果
从 Cholec80 视频提取帧并对应阶段标注,组织为训练、特征提取与评估使用的数据索引,为后续模型比较建立一致的数据基础。
基于图像与文本编码器的特征训练轻量阶段适配器,通过归一化表示与余弦相似度完成匹配,并与基础 CLIP 比较领域适配前后的排序表现。
比较 Top-1 / Top-5 命中率与不同阶段的表现,结合样例和可视化解释结果;进一步检验 INT8 适配器与 PQ 特征压缩,分别记录效果、存储和运行开销。

03 / Experiments
准确率、体积与运行开销
在包含训练数据的 184,578 帧全量评估中,阶段适配后 Top-1 从 17.77% 提升至 51.55%,Top-5 从 83.96% 提升至 96.18%。
以下为仓库记录的全量帧评估。每帧在 7 个候选阶段文本中进行匹配;Top-1 / Top-5 表示正确阶段位于前 1 / 5 个结果的比例。
| 模型 | Top-1 | Top-5 |
|---|---|---|
| Baseline CLIP | 17.77% | 83.96% |
| Phase-Adapted CLIP | 51.55% | 96.18% |
| Adapted CLIP · INT8 | 51.03% | 95.75% |
INT8 Adapter
74.7% ↓
FP32 2.006 MiB → INT8 0.507 MiB。该数字仅指适配器文件,不包含 CLIP 主干。
查看量化实验 ↗Product Quantization
≈150×
180.252 MiB → 1.204 MiB,基于 92,289 个向量的编码与码本存储估计。
查看 PQ 实验 ↗在仓库记录的 CPU 基准中,适配器单独运行的延迟从 FP32 的 0.0474 ms 增至 INT8 的 0.1605 ms。因此,本次 INT8 实验体现的是体积收益与运行开销之间的取舍。
仓库已记录亮度与模糊扰动下的初步结果。下一步是按视频划分独立测试集,统一评估与计时口径,并在一致的样本和模型流程下复核稳定性。
04 / Publication
论文、源码与实验依据
CSCWD 2026
29th International Conference on Computer Supported Cooperative Work in Design · 2026 · pp. 1739–1744
@inproceedings{cao2026surgclip,
author = {Yueran Cao and Jier Zhang and Junheng Fang
and Yushan Pan and Nan Xiang},
title = {SurgClip: Accelerated Domain-Adaptive CLIP
for Surgical Keyframe-Text Retrieval},
booktitle = {Proceedings of the 29th International
Conference on Computer Supported
Cooperative Work in Design (CSCWD)},
year = {2026},
pages = {1739--1744},
url = {https://ieeexplore.ieee.org/document/11582803}
}论文信息依据项目 README 整理;结果来自仓库公开的实验记录。项目用于学术研究,Cholec80 数据的使用须遵循其数据集条款。内容来源 ↗