文章

医疗影像AI通用逻辑与第一性原理

医疗影像AI通用逻辑与第一性原理

医疗影像AI通用逻辑与第一性原理

非诊疗建议。医疗影像里模型名目繁多,初学者容易被各种 Net 淹没。本文从任务类型、通用流水线、特征与决策、局部与全局几层,说明「通用逻辑」是什么、为什么不是「一个模型通吃一切」。帮助建立整体认知,不替代课程、论文与临床规范。


目录


一、结论先行

  • 通用的是「问题分解方式 + 训练与使用流程」,不是某一个固定网络名字。
  • 不同的 Net 多半是同一套逻辑下的不同「零件」(如何从像素抽特征、如何综合成判断),针对数据特点做替换或组合,而不是每种影像各有一套无关的「宇宙物理」。

可以记住一句话:

医学影像 AI ≈ 用大量「图 + 标签」教会计算机:在什么位置、什么模式下,对应什么临床含义。


二、第一性原理:任务类型

从最根本出发,只有几类任务(与 CT、MRI、X 光、超声无关的同一套问法):

任务类型在问什么生活化类比影像例子
分类整张图(或一次检查)属于哪一类?看一张照片判断「有没有下雨」胸片:有无肺炎征象;眼底:有无糖尿病视网膜病变
检测异常在哪?框出来在街景里圈出「所有的车」肺结节检测:圈出结节位置
分割每个像素属于什么?用画笔把「人」和「背景」涂开肿瘤勾画、器官轮廓
配准 / 重建等对齐、增强、去噪、三维重建把两张地图叠在一起多时相 CT 对齐(更偏工程,此处略)

换模态(X 光 / CT / MRI)时,变的主要是:

  • 图像长什么样(2D 投影 vs 断层切片)
  • 噪声与对比度
  • 标签怎么标
  • 临床问的问题

而不是「世界上又多了一套全新的数学」。


三、通用流水线

几乎所有项目都长这样:

1
2
3
4
5
6
数据(影像 + 标签/报告)
    → 预处理(尺寸、窗宽窗位、归一化、增强)
    → 模型(特征提取 + 决策头)
    → 训练(损失函数、优化器、验证集)
    → 推理(概率、框、分割 mask)
    → 后处理 + 临床工作流(阈值、质控、人工复核)

底层逻辑应优先掌握这条链,而不是背几十个 Net 名字。


四、特征提取与决策头

把模型想成两部分:

  1. 特征提取:从像素里提炼「对任务有用的模式」
  2. 决策头:根据特征输出类别、框或 mask

通俗例子:学认「苹果」

  • 特征:颜色红、表面圆润、有果蒂……
  • 决策:是苹果 / 不是苹果

医学影像里

  • 特征:边缘、纹理、对称性、局灶致密影、肺纹理增粗……
  • 决策:有无结节、是否肺炎、积液概率……

各种 Net(ResNet、DenseNet、U-Net、ViT…)本质是在竞争:谁更会用更少数据、更稳地从像素里抽出好特征。


五、CNN 与 Transformer 两种看片方式

不必记每个名字,先记两种互补的看片习惯

方式第一性原理通俗类比擅长
卷积 CNN从小范围邻域逐层组合,形成层次特征放大镜:先看边缘纹理,再看局部结构小病灶、细节、纹理
Transformer(ViT 等)任意区域可直接「对话」,建模长距离关系退后看全图:左右肺对称吗?心影大吗?全局布局、对称性、远距关联

为何常做融合(如 DenseNet + ViT)?
真实阅片既要看细节又要看全图——这不是两种病配两种算法,而是同一任务需要两种信息,所以用两个分支再合并。


六、Net 名字:家族而非五十个宇宙

把名字当成「车型」,不是五十种交通方式:

家族核心想法何时常被提起
CNN 骨干(ResNet、DenseNet、EfficientNet…)越深越抽象的特征;DenseNet 强调特征复用分类、检测 backbone
U-Net 系编码器下采样 + 解码器上采样,跳跃连接保留位置分割(器官、肿瘤勾画)
检测头(YOLO、Faster R-CNN 等)在特征图上预测框结节、病灶定位
Transformer / ViTpatch + 自注意力需要全局关系、或多模态大模型

6.1 名字里的缩写:Res / Dense / U / ViT

初学者常被字母绊住。前缀/缩写多半直接点出核心结构点子,不是随便起的花名:

名字缩写含义在说什么
ResNetResidual(残差)主路学「变化量」,再与输入相加(残差连接),减轻深层难训、梯度消失
DenseNetDense(稠密)每层拼接前面多层特征(稠密连接),强调特征复用与信息流动
U-Net结构形似字母 U左支下采样(编码)、右支上采样(解码),中间跳跃连接,整体呈 U 形,适合分割
ViTVision Transformer把图像切成 patch 当「词」,用 Transformer 自注意力做视觉骨干

一句话对照:

  • Res = 残差捷径;Dense = 层层密连;U = U 形编解码;ViT = 视觉版 Transformer。

论文里换名字,往往是改连接方式(密连接、残差)、改多尺度(特征金字塔)、改注意力,目标仍是:更好的特征 + 更稳的训练

初学者策略:先搞清任务(分类/检测/分割)→ 再认 2~3 个代表结构,其余当「改良款」。


七、医学影像上的附加约束

同一套深度学习逻辑,在医学里常多几条约束(也解释了为何论文爱加模块):

医学特点第一性原因设计上的常见回应(举例)
病灶小像素少,易被下采样抹掉高分辨率分支、特征金字塔、小目标检测技巧
正负样本不平衡正常图远多于明显异常加权损失、LSE 等池化、采样策略
标签噪声 / 主观性医生之间也会有差异多专家标注、弱监督、一致性训练
域偏移不同医院设备、协议不同域适应、外部验证、持续校准
可解释与合规不能只给一个分数显著性图、热图、人工复核流程

因此:不是「胸片一套宇宙、CT 另一套宇宙」,而是同一流水线 + 医学数据的额外难点


八、不同模态变的是什么

模态图像本质模型逻辑是否全新?
X 光 / 胸片2D 投影,重叠否;仍是 2D 分类/检测/分割
CT断层,常按切片3D 体输入否;常用 2.5D(多切片堆通道)或 3D CNN
MRI多序列、对比度机制不同否;预处理与序列融合更重要
超声噪声大、操作者依赖否;数据增强与域适应更关键
病理切片极大图,常分块 + 聚合否;「切块推理 + 整张投票」

直观上「每种都不一样」,往往来自:数据形态 + 临床任务 + 论文模块名,而不是底层目标不同。


九、用胸片例子串起来

任务:判断是否有某类胸片异常(分类),并希望知道大概看哪里(显著性)。

  1. 数据:胸片 + 标签(有/无某征象,或多标签)。
  2. 预处理:缩放到统一尺寸、对比度归一化。
  3. 特征
    • DenseNet 支路:小结节、纹理(放大镜);
    • ViT 支路:左右对称、心影(全图)。
  4. 融合 + 决策:拼特征 → 显著性图 → 概率。
  5. 临床:医生看热图是否合理,再决定是否采纳。

换到 CT 肺结节,逻辑仍是:检测/分割 + 小目标 + 3D 上下文,可能把 ViT 换成 3D U-Net,但「特征 + 决策」「局部 + 全局」的思想仍在。

双分支与融合的更细解读,见同专栏《胸片模型DenseNet-ViT与图像融合简介》。公开胸片多标签与 TorchXRayVision 实践见《胸片多标签分类疾病检测技术简介》。


十、初学者学习路线

  1. 先固定任务:分类 / 检测 / 分割 选一个玩透。
  2. 再认一条流水线:数据 → 训练 → 验证 → 推理。
  3. 只深入 2 个代表模型:如 ResNet(分类骨干)+ U-Net(分割),其余当变体。
  4. 理解「为什么」的两对矛盾
    • 局部 vs 全局 → CNN vs Transformer / 双分支;
    • 数据少 vs 模型大 → 预训练、迁移学习、增强。
  5. 医学专题放后:类不平衡、可解释性、多中心验证。

心智地图

1
2
3
4
5
6
7
8
9
第一性原理:从像素模式预测临床标签(分类/定位/勾画)
        ↓
通用流水线:数据 → 预处理 → 模型(特征+头) → 训练/推理 → 临床
        ↓
特征层矛盾:局部细节 ←→ 全局关系  →  常导致 CNN + Transformer 或金字塔
        ↓
医学附加题:病灶小、不平衡、域偏移、可解释
        ↓
各种 Net 名字:同一逻辑下的不同零件/改良款,不必逐个深啃

十一、小结

要点结论
通用逻辑任务分解 + 流水线;不是某一个 Net 名字
模型本质特征提取 + 决策头
CNN / ViT局部细节 vs 全局关系,常互补融合
模态差异主要是数据形态与临床问题,非全新数学
学习顺序任务 → 流水线 → 少数代表结构 → 医学约束
本文由作者按照 CC BY 4.0 进行授权