最新细胞形态分析学习顺序

王, 航弛 发布于 4 小时前 11 次阅读


AI 摘要

别急着追最“新”的模型。细胞形态分析真正决定结果的,不是算法热度,而是图像质量、分割精度和统计设计。本文将给你一条更稳妥的学习路线:从 CellProfiler 到 Cellpose,再到 StarDist、Zernike、CAJAL,少走弯路。

可以。先给你一个结论:

不要把“老算法全部放弃”理解成“只学最新模型”。
比较稳妥的路线是:

  • VAMPIRE:只学原理和基本复现,不作为主力工具
  • Cellpose-SAM/Cellpose4:当前优先级最高的通用分割路线
  • StarDist:细胞核、类圆形且互相粘连目标的专用路线
  • CellProfiler:可重复的测量和批处理平台
  • Fourier/Zernike:作为形状表示基础
  • CAJAL/深度学习 embedding:在有明确科研问题后再学

以下时间以 2026 年 8 月为准。

一、这些路线什么时候出现、现在更新到哪一步

工具或方法 首次出现/关键论文 近年状态 适合做什么
Cellpose 原始论文 2021 年发表;早期方法在 2020 年前后公开 仍在快速更新;Cellpose3 论文发表于 2025-02-12;Cellpose-SAM 预印本发表于 2025-05-01;官方仓库显示 Cellpose 4.2.1.1 于 2026-06-14 发布 通用细胞、细胞核、细菌、组织中细胞分割
StarDist 2D 方法发表于 2018;3D 扩展发表于 2020 方法相对成熟,更新速度不如 Cellpose,但仍广泛使用 细胞核、近似星凸、互相粘连的目标
CellProfiler 2008 年开始形成成熟平台;CellProfiler 4 论文发表于 2021 它不是单一 AI 算法,而是持续使用的图像分析工作流平台 预处理、分割结果管理、形态/强度/纹理测量、批量分析
Fourier descriptors 经典数字形状表示,主要在 1970—1990 年代发展 不是新算法,但仍常用于轮廓压缩和形状比较 轮廓表示、形状重建、降维
Zernike moments 经典不变矩方法,主要在 1980—1990 年代发展 仍用于形状特征工程和机器学习输入 旋转不变形状特征
Morphological profiling / Cell Painting 2010 年代中后期逐渐成熟 2020—2026 年进入深度学习、多模态和高内涵筛选阶段 药物表型、基因扰动、细胞状态和机制推断
CAJAL 论文发表于 2023 仍是较新的形态空间和多模态整合工具 神经元等复杂形态、形态与转录组/电生理整合

Cellpose3 的主要更新是把图像恢复与分割结合起来,改善低质量、模糊和噪声图像的分割;Cellpose-SAM 则把 SAM 的视觉基础模型路线引入细胞分割。官方仓库在 2026 年仍有 Cellpose4 系列发布,说明它目前仍是活跃路线。(nature.com (nature.com))

StarDist 的 2D 和 3D 方法分别建立在 2018、2020 年的论文上,核心优势是用 star-convex polygon/polyhedron 描述目标,因此对细胞核和相互接触的近圆形目标尤其合适。(github.com (github.com))

CAJAL 不是分割软件,而是对已经得到的细胞形态进行 Gromov-Wasserstein 距离建模,并构建形态 latent space;它可以把形态与单细胞转录组等数据联系起来。(nature.com (nature.com))

二、对服务器有什么要求

1. Cellpose / Cellpose-SAM / Cellpose4

最低可用配置:

  • CPU:4 核以上
  • 内存:至少 8 GB
  • 实际推荐:16–32 GB
  • GPU:可选,但强烈建议有
  • GPU:NVIDIA 显卡最省心,建议 6–12 GB 显存起步
  • 大图、3D、批量任务:建议 12–24 GB 显存

官方说明至少需要 8 GB RAM,大图和 3D 数据通常需要 16–32 GB;GPU 运行需要正确安装驱动和 CUDA 环境。(github.com (github.com))

实际选择可以这样理解:

  • 只分析几百张 2D 图片:CPU 可以跑
  • 每天分析几千张图:建议 GPU
  • Cellpose-SAM、3D、大尺寸组织图:建议 12 GB 以上显存
  • 没有 GPU:可以先用在线演示或 CPU 模式验证流程

2. StarDist

推荐配置:

  • CPU:4–8 核
  • 内存:16 GB
  • GPU:NVIDIA GPU,8 GB 显存比较舒服
  • 3D 数据:建议 16 GB 以上显存,或者切块处理

StarDist 通常依赖 TensorFlow、CUDA 和 cuDNN,GPU 环境配置有时比 Cellpose 更麻烦。(github.com (github.com))

如果只是做 2D 细胞核分割,普通工作站也够用;如果是 3D 共聚焦堆栈,GPU 和内存压力会明显增加。

3. CellProfiler

CellProfiler 主要是 CPU 和内存受限,不是典型 GPU 深度学习软件。简单流程普通电脑即可;多通道、高分辨率、多孔板批处理时,更需要:

  • CPU:8–16 核
  • 内存:32–64 GB
  • 存储:NVMe SSD
  • GPU:只有调用 Cellpose、StarDist 等模型时才重要

CellProfiler 官方定位是无需编程即可完成生物图像定量分析的平台;CellProfiler 4 主要提升了处理速度和工作流能力。(cellprofiler.org (cellprofiler.org))

4. Fourier、Zernike、PCA、UMAP、聚类

这些通常不需要 GPU:

  • CPU:4–8 核
  • 内存:16–32 GB
  • 处理几十万细胞时:建议 64 GB
  • GPU:基本不需要

这部分反而是最适合在笔记本上学习的。

5. CAJAL

CAJAL 的瓶颈通常不是显卡,而是:

  • 形态距离矩阵计算
  • 细胞数量
  • 复杂形态的点数或树结构

几千个细胞一般可在普通工作站上尝试;如果数据规模很大,内存和计算时间会快速上升。CAJAL 的优点是形态距离具有明确数学含义,但大规模距离矩阵会限制扩展性。(nature.com (nature.com))

三、你应该按什么顺序学

阶段 1:先学图像和实验质量控制

先掌握:

  • 像素、位深、通道、Z-stack
  • 背景扣除、去噪、对比度
  • 过曝、欠曝、漂白、批次效应
  • 什么是 biological replicate 和 technical replicate

这一阶段不要急着训练模型。

阶段 2:学 CellProfiler

先用 CellProfiler 建立完整流程:

加载图像 → 预处理 → 分割 → 测量 → 导出表格 → 质控

你会学到面积、周长、圆度、长宽比、纹理、强度、细胞器关系等可解释指标。

阶段 3:学 Cellpose

建议顺序:

  1. Cellpose 通用模型
  2. 自己的数据测试
  3. 少量人工修正
  4. Cellpose3 图像恢复
  5. Cellpose-SAM/Cellpose4
  6. 必要时再做微调或自定义模型

先理解“模型是否真的分对了”,再追求更复杂的模型。

阶段 4:学 StarDist

当你的目标主要是:

  • 细胞核
  • 细胞核密集排列
  • 细胞边界相互接触
  • 目标总体接近圆形或星形

再学习 StarDist。它不一定比 Cellpose 更通用,但在这类问题上往往更有针对性。

阶段 5:补传统形状表示

此时再学:

  • Fourier descriptors
  • Zernike moments
  • PCA
  • UMAP
  • k-means、层次聚类
  • 分类器和批次效应校正

这一步就是把“分割出来的细胞”转化为“可比较的形态表型”。

阶段 6:最后学形态组学和 CAJAL

当你已经有:

  • 稳定的分割
  • 可靠的特征表
  • 明确的实验分组
  • 足够的细胞数量
  • 规范的重复和统计设计

再进入:

  • Cell Painting
  • 深度学习 embedding
  • 自监督学习
  • 形态与转录组整合
  • CAJAL
  • 多模态表示学习

四、给你的实际建议

如果你是从 VAMPIRE 转过来,我建议采用这条路线:

CellProfiler → Cellpose → StarDist → Python 统计与可视化 → Fourier/Zernike → Cellpose-SAM/Cellpose4 → 形态组学/CAJAL

不要一开始就把重点放在 CAJAL 或大型基础模型上。对绝大多数细胞形态课题,真正决定结果质量的顺序是:

  1. 图像质量
  2. 分割质量
  3. 细胞级质控
  4. 特征选择
  5. 批次校正
  6. 统计设计
  7. 最后才是模型复杂度

如果你的服务器目前只有普通 CPU 和 16 GB 内存,仍然可以开始学 CellProfiler、传统特征、PCA、聚类和基础 Cellpose;等你确认数据确实需要大规模推理,再配置 NVIDIA GPU。

此作者没有提供个人介绍。
最后更新于 2026-08-29