从 patch 热力图到 U-Net:肝脏识别进度记录

从 patch 热力图到 U-Net:肝脏识别进度记录 0. 背景 好久没更新博客了。 上一次还在看 nnU-Net 的论文,想着先把数据空间、预处理和输入格式这些基础问题弄明白。后来真正开始做肝脏识别,路线也从一开始的 patch 分类和粗 ROI,慢慢走到了现在的 U-Net 像素级分割。 这篇不打算写成很完整的教程,主要想记一下: 为什么换模型、换完以后做了什么,以及现在到底做到哪一步了。 先说明一下,目前实际训练的是自己写的轻量 2D U-Net baseline,并不是直接运行官方 nnU-Net。完整代码放在公开仓库里:liver-segmentation code。 1. 换模型前,旧方案卡在哪里 换 U-Net 之前,做的是一个监督式对比学习的 patch 分类器。 它会判断一个 96 × 96 的 CT patch 是 liver 还是 non-liver,然后在完整 CT 上滑窗,把每个 patch 的概率重新叠回三维空间,最后得到一张肝脏热力图。 这条路线不是完全没用。它确实能大致找到肝脏,也很适合验证“模型到底有没有学到肝脏区域”。但越往后做,问题越明显: 它学的是“这个 patch 里像不像有肝脏”,不是“每一个像素是不是肝脏”; 滑窗概率回填以后,边缘容易变厚、变糊; 模型只看局部,容易把附近灰度相似的器官和软组织一起圈进来; 阈值一改,Recall 和 Precision 就会明显拉扯; 最大连通域、闭运算、矢状面过滤都能清掉一些小块,但更像是在补救结果。 旧方案最后选中的是 epoch 40、阈值 0.80。在 4 个完整验证 CT 上,平均 Recall 是 0.9504,Precision 是 0.7266,Dice 是 0.8220。 召回率已经不算低,但误检还是很多。这个时候继续给后处理叠规则,收益越来越有限。后来想明白,问题不只是模型容量不够,而是任务本身没有对齐: 想要的是一张像素级 mask,却一直在训练一个 patch 级分类器。 所以决定换成 U-Net。 2. 先把 U-Net 的最小闭环跑通 这次没有一上来就堆很复杂的结构,而是先写了一个比较小的 2D U-Net: 单通道轴向 CT 输入; 4 层 encoder 和 decoder; skip connection; GroupNorm; base channels 为 16; 总参数量约 194 万。 输出也从“这个 patch 是不是肝脏”,变成了“这一张切片上每个像素属于肝脏的概率”。

阅读全文 »