图像/视频分割 VIDEO STREAM SEGMENTATION

ROLE RESEARCH INTERN

2025.09–至今

image-segmentation 主视觉图

(Overview)

SAM,全称Segment Anything Model——Meta搞出来的"万物皆可分割"模型。给它一张图,点一个位置,它就能把那个"东西"的轮廓完整地框出来。 我首先用它做的是人物实例分割:给一段Tim的日常Vlog,让原生SAM2在视频流里追踪Tim——框住人,跟踪他的移动轨迹。原生SAM2干得不错。
但重点在后面:如果拿一个在手术视频上微调过的"SAM"(ReSurgSAM2)去看同一段Vlog呢?它闹笑话了——把眼镜当手术剪、把远山当刀刃。我把这叫做"语义入侵"。这个bug,比完美结果更有意思。

(Video)

原生 SAM2 · 人物实例分割。逐帧追踪 Tim——"这一团像素,到底是谁?"

  • 指尖创世与ResurgSAM2分割对比

    (A) 米开朗基罗·指尖创世——那一触,命名世界的开始

  • ResurgSAM2分割掩码与指尖创世动作

    (B) ReSurgSAM2·器械分割掩码——那一框,界定存在的瞬间

(Description)

研究背景
MICCAI 2025 Early Accepted 的 ReSurgSAM2 完整复现。手术器械分割场景极其刁钻:无影灯下的钳子反光、血雾模糊的刃口、手腕快速翻转时的运动模糊——每一帧都是一场辨认游戏。HUST | WNLO 算法研究实习生项目。
目标
复现 ReSurgSAM2(CSTMamba + CIFS + DLM 架构),验证其在 Ref-Endovis17 手术视频上的分割性能。更关键的是:把它从"手术室"迁移到"日常生活",故意看它在没见过的场景里怎么崩溃。
技术方案
SAM2(Hiera 架构)做基础视频流分割框架 + Memory Bank 时间记忆。CSTMamba(跨模态时空 Mamba)把 CLIP 文本特征和视觉特征揉在一起,用语言先验引导分割。CIFS 选可信初始帧,DLM(多样性长期记忆)防遗忘。SAM2.1 原生权重做对比基线。关键教训:CSTMamba 的多模态融合虽强,但也带来了"语义先验过强"的副作用——这也是语义入侵的根源。
核心成果
Ref-Endovis17 验证集 76.98% J&F / 80.56% Dice / 61.2 FPS。解决 CUDA 11.7→12.2 版本冲突(无需 root 权限)。offload_video_to_cpu 显存优化:15GB→5-7GB(降幅 50-70%)。Tim 日常视频迁移实验发现"语义入侵"——眼镜→手术剪,远山→刀刃。由此引出 SAM3 presence token 改进思路。
我的角色
HUST | WNLO 算法研究实习生(2025.09–至今)。完整复现 ReSurgSAM2(架构搭建 + 训练 + 评估全流程)。将模型从手术器械分割扩展到人物实例分割(Tim Vlog),独立发现并分析"语义入侵"现象。GitHub: xiaoaojianghu6/rss2

(NEXT PROJECT)

多模态心脏诊断智能体

信号处理(EEG+rPPG)rPPG · EEG · SIGNAL PROCESSING

ROLE INDEPENDENT RESEARCH

2024

独立成分分析脑电信号处理(EEG+rPPG)封面

(Overview)

两个独立信号处理实验,主题相近:从噪声里提取隐藏的生理信息。一个看脸——rPPG 从视频帧里读心率,不接触;一个看脑——EEG 从多通道电信号里分离脑波与伪迹,FFT + ICA 各显神通。

rPPG 信号与心率检测结果

(Unfold)

测心率通常要指夹或电极——接触式、有门槛。rPPG(远程光电容积描记法)换个路子:对着脸录视频,从皮肤血液容积变化造成的微弱色差里反推生理信号。我从零搭了一个 rPPG 基础框架:MediaPipe Face Mesh 定位额头 ROI → 抠绿色通道平均亮度变化提取原始 BVP → 去趋势 + 带通滤波(0.7–4.0Hz)+ 归一化 → 滑动窗口 FFT 算动态心率 → 峰值检测算 RR 间期,输出时域 HRV(RMSSD/SDNN)。

在 UBFC-rPPG 数据集 52 秒视频上跑通:FFT 估算心率与 ground truth 趋势高度重合(约 100–110 BPM),庞加莱图显示 RR 间期集中在 800–1000ms。算法库 pyVHR 环境冲突,索性从零手写信号提取与分析全流程——踩坑反而是最扎实的部分。GitHub: xiaoaojianghu6/rppg-estimation。

脑电信号频率提取结果

(Unfold)

脑电图(EEG)信号是多通道、低信噪比的时序数据,眼动、肌电等伪迹混杂其中——把真正的神经振荡从噪声堆里挑出来,是信号处理的经典难题。我用了两条路线:FFT 频域分析把信号分解为 Delta/Theta/Alpha/Beta/Gamma 五个脑波频带,量化各频带功率分布;ICA 独立成分分析提取 9 个成分,识别并剔除疑似眼电/肌电伪迹(成分 0、1、8),对比处理前后 Beta 波功率变化——干扰显著下降。基于 MNE-Python + SciPy 实现完整流水线。

返回列表

(NEXT PROJECT)

AI 自动化工作流

<