医疗影像AI通用逻辑与第一性原理
医疗影像AI通用逻辑与第一性原理
非诊疗建议。医疗影像里模型名目繁多,初学者容易被各种 Net 淹没。本文从任务类型、通用流水线、特征与决策、局部与全局几层,说明「通用逻辑」是什么、为什么不是「一个模型通吃一切」。帮助建立整体认知,不替代课程、论文与临床规范。
目录
- 一、结论先行
- 二、第一性原理:任务类型
- 三、通用流水线
- 四、特征提取与决策头
- 五、CNN 与 Transformer 两种看片方式
- 六、Net 名字:家族而非五十个宇宙
- 七、医学影像上的附加约束
- 八、不同模态变的是什么
- 九、用胸片例子串起来
- 十、初学者学习路线
- 十一、小结
一、结论先行
- 通用的是「问题分解方式 + 训练与使用流程」,不是某一个固定网络名字。
- 不同的 Net 多半是同一套逻辑下的不同「零件」(如何从像素抽特征、如何综合成判断),针对数据特点做替换或组合,而不是每种影像各有一套无关的「宇宙物理」。
可以记住一句话:
医学影像 AI ≈ 用大量「图 + 标签」教会计算机:在什么位置、什么模式下,对应什么临床含义。
二、第一性原理:任务类型
从最根本出发,只有几类任务(与 CT、MRI、X 光、超声无关的同一套问法):
| 任务类型 | 在问什么 | 生活化类比 | 影像例子 |
|---|---|---|---|
| 分类 | 整张图(或一次检查)属于哪一类? | 看一张照片判断「有没有下雨」 | 胸片:有无肺炎征象;眼底:有无糖尿病视网膜病变 |
| 检测 | 异常在哪?框出来 | 在街景里圈出「所有的车」 | 肺结节检测:圈出结节位置 |
| 分割 | 每个像素属于什么? | 用画笔把「人」和「背景」涂开 | 肿瘤勾画、器官轮廓 |
| 配准 / 重建等 | 对齐、增强、去噪、三维重建 | 把两张地图叠在一起 | 多时相 CT 对齐(更偏工程,此处略) |
换模态(X 光 / CT / MRI)时,变的主要是:
- 图像长什么样(2D 投影 vs 断层切片)
- 噪声与对比度
- 标签怎么标
- 临床问的问题
而不是「世界上又多了一套全新的数学」。
三、通用流水线
几乎所有项目都长这样:
1
2
3
4
5
6
数据(影像 + 标签/报告)
→ 预处理(尺寸、窗宽窗位、归一化、增强)
→ 模型(特征提取 + 决策头)
→ 训练(损失函数、优化器、验证集)
→ 推理(概率、框、分割 mask)
→ 后处理 + 临床工作流(阈值、质控、人工复核)
底层逻辑应优先掌握这条链,而不是背几十个 Net 名字。
四、特征提取与决策头
把模型想成两部分:
- 特征提取:从像素里提炼「对任务有用的模式」
- 决策头:根据特征输出类别、框或 mask
通俗例子:学认「苹果」
- 特征:颜色红、表面圆润、有果蒂……
- 决策:是苹果 / 不是苹果
医学影像里
- 特征:边缘、纹理、对称性、局灶致密影、肺纹理增粗……
- 决策:有无结节、是否肺炎、积液概率……
各种 Net(ResNet、DenseNet、U-Net、ViT…)本质是在竞争:谁更会用更少数据、更稳地从像素里抽出好特征。
五、CNN 与 Transformer 两种看片方式
不必记每个名字,先记两种互补的看片习惯:
| 方式 | 第一性原理 | 通俗类比 | 擅长 |
|---|---|---|---|
| 卷积 CNN | 从小范围邻域逐层组合,形成层次特征 | 放大镜:先看边缘纹理,再看局部结构 | 小病灶、细节、纹理 |
| Transformer(ViT 等) | 任意区域可直接「对话」,建模长距离关系 | 退后看全图:左右肺对称吗?心影大吗? | 全局布局、对称性、远距关联 |
为何常做融合(如 DenseNet + ViT)?
真实阅片既要看细节又要看全图——这不是两种病配两种算法,而是同一任务需要两种信息,所以用两个分支再合并。
六、Net 名字:家族而非五十个宇宙
把名字当成「车型」,不是五十种交通方式:
| 家族 | 核心想法 | 何时常被提起 |
|---|---|---|
| CNN 骨干(ResNet、DenseNet、EfficientNet…) | 越深越抽象的特征;DenseNet 强调特征复用 | 分类、检测 backbone |
| U-Net 系 | 编码器下采样 + 解码器上采样,跳跃连接保留位置 | 分割(器官、肿瘤勾画) |
| 检测头(YOLO、Faster R-CNN 等) | 在特征图上预测框 | 结节、病灶定位 |
| Transformer / ViT | patch + 自注意力 | 需要全局关系、或多模态大模型 |
6.1 名字里的缩写:Res / Dense / U / ViT
初学者常被字母绊住。前缀/缩写多半直接点出核心结构点子,不是随便起的花名:
| 名字 | 缩写含义 | 在说什么 |
|---|---|---|
| ResNet | Residual(残差) | 主路学「变化量」,再与输入相加(残差连接),减轻深层难训、梯度消失 |
| DenseNet | Dense(稠密) | 每层拼接前面多层特征(稠密连接),强调特征复用与信息流动 |
| U-Net | 结构形似字母 U | 左支下采样(编码)、右支上采样(解码),中间跳跃连接,整体呈 U 形,适合分割 |
| ViT | Vision Transformer | 把图像切成 patch 当「词」,用 Transformer 自注意力做视觉骨干 |
一句话对照:
- Res = 残差捷径;Dense = 层层密连;U = U 形编解码;ViT = 视觉版 Transformer。
论文里换名字,往往是改连接方式(密连接、残差)、改多尺度(特征金字塔)、改注意力,目标仍是:更好的特征 + 更稳的训练。
初学者策略:先搞清任务(分类/检测/分割)→ 再认 2~3 个代表结构,其余当「改良款」。
七、医学影像上的附加约束
同一套深度学习逻辑,在医学里常多几条约束(也解释了为何论文爱加模块):
| 医学特点 | 第一性原因 | 设计上的常见回应(举例) |
|---|---|---|
| 病灶小 | 像素少,易被下采样抹掉 | 高分辨率分支、特征金字塔、小目标检测技巧 |
| 正负样本不平衡 | 正常图远多于明显异常 | 加权损失、LSE 等池化、采样策略 |
| 标签噪声 / 主观性 | 医生之间也会有差异 | 多专家标注、弱监督、一致性训练 |
| 域偏移 | 不同医院设备、协议不同 | 域适应、外部验证、持续校准 |
| 可解释与合规 | 不能只给一个分数 | 显著性图、热图、人工复核流程 |
因此:不是「胸片一套宇宙、CT 另一套宇宙」,而是同一流水线 + 医学数据的额外难点。
八、不同模态变的是什么
| 模态 | 图像本质 | 模型逻辑是否全新? |
|---|---|---|
| X 光 / 胸片 | 2D 投影,重叠 | 否;仍是 2D 分类/检测/分割 |
| CT | 断层,常按切片或3D 体输入 | 否;常用 2.5D(多切片堆通道)或 3D CNN |
| MRI | 多序列、对比度机制不同 | 否;预处理与序列融合更重要 |
| 超声 | 噪声大、操作者依赖 | 否;数据增强与域适应更关键 |
| 病理切片 | 极大图,常分块 + 聚合 | 否;「切块推理 + 整张投票」 |
直观上「每种都不一样」,往往来自:数据形态 + 临床任务 + 论文模块名,而不是底层目标不同。
九、用胸片例子串起来
任务:判断是否有某类胸片异常(分类),并希望知道大概看哪里(显著性)。
- 数据:胸片 + 标签(有/无某征象,或多标签)。
- 预处理:缩放到统一尺寸、对比度归一化。
- 特征:
- DenseNet 支路:小结节、纹理(放大镜);
- ViT 支路:左右对称、心影(全图)。
- 融合 + 决策:拼特征 → 显著性图 → 概率。
- 临床:医生看热图是否合理,再决定是否采纳。
换到 CT 肺结节,逻辑仍是:检测/分割 + 小目标 + 3D 上下文,可能把 ViT 换成 3D U-Net,但「特征 + 决策」「局部 + 全局」的思想仍在。
双分支与融合的更细解读,见同专栏《胸片模型DenseNet-ViT与图像融合简介》。公开胸片多标签与 TorchXRayVision 实践见《胸片多标签分类疾病检测技术简介》。
十、初学者学习路线
- 先固定任务:分类 / 检测 / 分割 选一个玩透。
- 再认一条流水线:数据 → 训练 → 验证 → 推理。
- 只深入 2 个代表模型:如 ResNet(分类骨干)+ U-Net(分割),其余当变体。
- 理解「为什么」的两对矛盾:
- 局部 vs 全局 → CNN vs Transformer / 双分支;
- 数据少 vs 模型大 → 预训练、迁移学习、增强。
- 医学专题放后:类不平衡、可解释性、多中心验证。
心智地图:
1
2
3
4
5
6
7
8
9
第一性原理:从像素模式预测临床标签(分类/定位/勾画)
↓
通用流水线:数据 → 预处理 → 模型(特征+头) → 训练/推理 → 临床
↓
特征层矛盾:局部细节 ←→ 全局关系 → 常导致 CNN + Transformer 或金字塔
↓
医学附加题:病灶小、不平衡、域偏移、可解释
↓
各种 Net 名字:同一逻辑下的不同零件/改良款,不必逐个深啃
十一、小结
| 要点 | 结论 |
|---|---|
| 通用逻辑 | 任务分解 + 流水线;不是某一个 Net 名字 |
| 模型本质 | 特征提取 + 决策头 |
| CNN / ViT | 局部细节 vs 全局关系,常互补融合 |
| 模态差异 | 主要是数据形态与临床问题,非全新数学 |
| 学习顺序 | 任务 → 流水线 → 少数代表结构 → 医学约束 |
