01_虚拟敲除方法年代尺

王, 航弛 发布于 3 小时前 7 次阅读


单细胞虚拟敲除/虚拟扰动方法年代尺

截止日期:2026-09-15。这里的“虚拟敲除”按广义计算基因扰动理解:模型在未实际进行 CRISPR/药物处理的情况下,预测某基因或基因组合被抑制、激活或删除后的转录状态/细胞状态变化。

纵向年代尺

2016 │ Perturb-seq 奠基
     │ CRISPR pooled screen 与单细胞 RNA-seq 联用,提供真实扰动训练集;严格说不是虚拟敲除,
     │ 但后来所有响应预测模型都依赖这类监督信号。
     │ 关键词:Perturb-seq / CRISPR screen / single-cell readout
     │
2019 │ scGen
     │ 变分自编码器框架,学习“对照 → 扰动”的细胞状态变化,可预测未观测条件下的单细胞响应。
     │ 局限:对训练分布外的基因、细胞类型和组合扰动依赖较强。
     │ DOI:10.1038/s41592-019-0494-8
     │
2020 │ CellOracle 类 GRN in-silico perturbation
     │ 先推断基因调控网络,再模拟 TF/节点扰动后的网络传播与细胞命运变化;更接近“机制型虚拟敲除”。
     │ 局限:结果受 GRN 先验、motif、峰-基因链接和网络推断稳定性影响。
     │ 代表性综述/方法入口:CellOracle gene-regulatory-network perturbation
     │
2020–2021 │ scTenifoldKnk
     │ 从单细胞表达推断多个 GRN,对目标基因节点执行 in-silico knockout,再比较网络拓扑和下游变化。
     │ 适合:候选基因优先级、网络脆弱性和通路级假设生成。
     │ 局限:不是实验敲除;对稀疏矩阵、网络方向性和细胞异质性敏感。
     │ DOI/软件入口:CRAN scTenifoldKnk;正式引用时需核对对应论文版本。
     │
2021–2022 │ CPA / MultiCPA
     │ 组合扰动自编码器,把细胞背景、剂量、处理和组合条件拆成可组合表示;从“单基因删除”扩展到组合处理。
     │ 局限:药物/剂量数据与基因 knockout 数据不能直接混为一类,需分层分析。
     │
2023 │ GEARS
     │ 图增强的基因激活/抑制模拟器,把基因关系知识图谱与图神经网络结合,预测单基因及多基因扰动,
     │ 尤其强调未实验观察组合的外推。作者报告在组合扰动任务上优于基线,但性能仍依赖训练屏幕和先验图谱。
     │ DOI:10.1038/s41587-023-01905-6;正式期刊卷期为 Nat Biotechnol. 2024;42:927–935。
     │
2023–2024 │ Geneformer / scGPT 等单细胞基础模型的扰动化使用
     │ 将大规模单细胞预训练表示用于细胞状态、靶点优先级和 perturbation fine-tuning;
     │ “基础模型能否可靠预测扰动”逐渐成为独立评价问题。
     │ 局限:零样本敲除并不等于因果识别,模型解释性、数据泄漏和跨平台泛化必须单独审计。
     │
2024–2025 │ 跨数据集、跨细胞类型的系统评测与流模型/最优传输模型
     │ 研究重点从“提出一个模型”转为比较 OOD 泛化、组合扰动、细胞类型迁移和不确定性校准。
     │ 建议把 benchmark 表现、真实验证和乳腺癌外部验证分成三个证据层级。
     │
2026-05-01 │ TxPert
     │ 发表在 Nature Biotechnology 的知识图谱整合模型,题为“using multiple knowledge graphs for prediction of
     │ transcriptomic perturbation effects”。它代表最新一代:把多个知识图谱用于转录组扰动效应预测。
     │ DOI:10.1038/s41587-026-03113-4;PMID:42067667。
     │
2026-09-09 │ 单细胞扰动响应预测系统比较
     │ Science Advances 发表系统比较,DOI:10.1126/sciadv.aed3414;该节点说明领域已进入“模型横向评测”阶段,
     │ 不能只根据单篇方法论文的 headline 指标判断最佳模型。

方法层级

层级 代表方法 核心输出 更适合回答的问题 主要风险
真实扰动数据 Perturb-seq、CRISPR screen 实验后的细胞表达/表型 某基因敲除后实际发生什么 成本高、筛选设计和脱靶
网络模拟 CellOracle、scTenifoldKnk 网络边、节点影响、下游程序 哪些调控节点可能是脆弱点 GRN 先验和方向性误差
生成式预测 scGen、CPA/MultiCPA 反事实细胞状态 未观测条件可能怎样变化 分布外泛化、批次和剂量
图/知识增强 GEARS、TxPert 单/组合扰动表达与相互作用 哪些组合值得实验验证 知识图谱偏倚、训练屏幕依赖
基础模型 Geneformer、scGPT 及后续模型 细胞状态、靶点和扰动响应表示 跨队列迁移和大规模候选排序 数据泄漏、可解释性、因果边界

对乳腺癌使用的判断

  1. 如果目标是“发现候选靶点”,优先采用 GRN 模拟 + GEARS/TxPert 类预测的交叉证据。
  2. 如果目标是“证明某基因导致耐药/转移”,虚拟敲除只能作为假设生成,必须有独立队列、Perturb-seq 或湿实验验证。
  3. 乳腺癌应按分子亚型、细胞区室和治疗背景分层;把 ER+、HER2+、TNBC 混成一个训练集会掩盖真实异质性。

可直接引用的核心文献

  • Lotfollahi M, et al. scGen predicts single-cell perturbation responses. Nature Methods. 2019. DOI: 10.1038/s41592-019-0494-8.
  • Roohani Y, Huang K, Leskovec J. Predicting transcriptional outcomes of novel multigene perturbations with GEARS. Nature Biotechnology. 2024;42:927–935. DOI: 10.1038/s41587-023-01905-6.
  • Wenkel F, et al. TxPert: using multiple knowledge graphs for prediction of transcriptomic perturbation effects. Nature Biotechnology. 2026. DOI: 10.1038/s41587-026-03113-4.
  • A systematic comparison of single-cell perturbation response prediction models. Science Advances. 2026. DOI: 10.1126/sciadv.aed3414.
此作者没有提供个人介绍。
最后更新于 2026-09-15