单细胞虚拟敲除/虚拟扰动方法年代尺
截止日期:2026-09-15。这里的“虚拟敲除”按广义计算基因扰动理解:模型在未实际进行 CRISPR/药物处理的情况下,预测某基因或基因组合被抑制、激活或删除后的转录状态/细胞状态变化。
纵向年代尺
2016 │ Perturb-seq 奠基
│ CRISPR pooled screen 与单细胞 RNA-seq 联用,提供真实扰动训练集;严格说不是虚拟敲除,
│ 但后来所有响应预测模型都依赖这类监督信号。
│ 关键词:Perturb-seq / CRISPR screen / single-cell readout
│
2019 │ scGen
│ 变分自编码器框架,学习“对照 → 扰动”的细胞状态变化,可预测未观测条件下的单细胞响应。
│ 局限:对训练分布外的基因、细胞类型和组合扰动依赖较强。
│ DOI:10.1038/s41592-019-0494-8
│
2020 │ CellOracle 类 GRN in-silico perturbation
│ 先推断基因调控网络,再模拟 TF/节点扰动后的网络传播与细胞命运变化;更接近“机制型虚拟敲除”。
│ 局限:结果受 GRN 先验、motif、峰-基因链接和网络推断稳定性影响。
│ 代表性综述/方法入口:CellOracle gene-regulatory-network perturbation
│
2020–2021 │ scTenifoldKnk
│ 从单细胞表达推断多个 GRN,对目标基因节点执行 in-silico knockout,再比较网络拓扑和下游变化。
│ 适合:候选基因优先级、网络脆弱性和通路级假设生成。
│ 局限:不是实验敲除;对稀疏矩阵、网络方向性和细胞异质性敏感。
│ DOI/软件入口:CRAN scTenifoldKnk;正式引用时需核对对应论文版本。
│
2021–2022 │ CPA / MultiCPA
│ 组合扰动自编码器,把细胞背景、剂量、处理和组合条件拆成可组合表示;从“单基因删除”扩展到组合处理。
│ 局限:药物/剂量数据与基因 knockout 数据不能直接混为一类,需分层分析。
│
2023 │ GEARS
│ 图增强的基因激活/抑制模拟器,把基因关系知识图谱与图神经网络结合,预测单基因及多基因扰动,
│ 尤其强调未实验观察组合的外推。作者报告在组合扰动任务上优于基线,但性能仍依赖训练屏幕和先验图谱。
│ DOI:10.1038/s41587-023-01905-6;正式期刊卷期为 Nat Biotechnol. 2024;42:927–935。
│
2023–2024 │ Geneformer / scGPT 等单细胞基础模型的扰动化使用
│ 将大规模单细胞预训练表示用于细胞状态、靶点优先级和 perturbation fine-tuning;
│ “基础模型能否可靠预测扰动”逐渐成为独立评价问题。
│ 局限:零样本敲除并不等于因果识别,模型解释性、数据泄漏和跨平台泛化必须单独审计。
│
2024–2025 │ 跨数据集、跨细胞类型的系统评测与流模型/最优传输模型
│ 研究重点从“提出一个模型”转为比较 OOD 泛化、组合扰动、细胞类型迁移和不确定性校准。
│ 建议把 benchmark 表现、真实验证和乳腺癌外部验证分成三个证据层级。
│
2026-05-01 │ TxPert
│ 发表在 Nature Biotechnology 的知识图谱整合模型,题为“using multiple knowledge graphs for prediction of
│ transcriptomic perturbation effects”。它代表最新一代:把多个知识图谱用于转录组扰动效应预测。
│ DOI:10.1038/s41587-026-03113-4;PMID:42067667。
│
2026-09-09 │ 单细胞扰动响应预测系统比较
│ Science Advances 发表系统比较,DOI:10.1126/sciadv.aed3414;该节点说明领域已进入“模型横向评测”阶段,
│ 不能只根据单篇方法论文的 headline 指标判断最佳模型。
方法层级
| 层级 | 代表方法 | 核心输出 | 更适合回答的问题 | 主要风险 |
|---|---|---|---|---|
| 真实扰动数据 | Perturb-seq、CRISPR screen | 实验后的细胞表达/表型 | 某基因敲除后实际发生什么 | 成本高、筛选设计和脱靶 |
| 网络模拟 | CellOracle、scTenifoldKnk | 网络边、节点影响、下游程序 | 哪些调控节点可能是脆弱点 | GRN 先验和方向性误差 |
| 生成式预测 | scGen、CPA/MultiCPA | 反事实细胞状态 | 未观测条件可能怎样变化 | 分布外泛化、批次和剂量 |
| 图/知识增强 | GEARS、TxPert | 单/组合扰动表达与相互作用 | 哪些组合值得实验验证 | 知识图谱偏倚、训练屏幕依赖 |
| 基础模型 | Geneformer、scGPT 及后续模型 | 细胞状态、靶点和扰动响应表示 | 跨队列迁移和大规模候选排序 | 数据泄漏、可解释性、因果边界 |
对乳腺癌使用的判断
- 如果目标是“发现候选靶点”,优先采用 GRN 模拟 + GEARS/TxPert 类预测的交叉证据。
- 如果目标是“证明某基因导致耐药/转移”,虚拟敲除只能作为假设生成,必须有独立队列、Perturb-seq 或湿实验验证。
- 乳腺癌应按分子亚型、细胞区室和治疗背景分层;把 ER+、HER2+、TNBC 混成一个训练集会掩盖真实异质性。
可直接引用的核心文献
- Lotfollahi M, et al. scGen predicts single-cell perturbation responses. Nature Methods. 2019. DOI: 10.1038/s41592-019-0494-8.
- Roohani Y, Huang K, Leskovec J. Predicting transcriptional outcomes of novel multigene perturbations with GEARS. Nature Biotechnology. 2024;42:927–935. DOI: 10.1038/s41587-023-01905-6.
- Wenkel F, et al. TxPert: using multiple knowledge graphs for prediction of transcriptomic perturbation effects. Nature Biotechnology. 2026. DOI: 10.1038/s41587-026-03113-4.
- A systematic comparison of single-cell perturbation response prediction models. Science Advances. 2026. DOI: 10.1126/sciadv.aed3414.
Comments NOTHING