乳腺癌方向文献计量分析:能不能做?
结论
能做,建议立项;但题目应定义为“乳腺癌中的计算基因扰动/虚拟敲除研究”,而不是只统计题名中出现 virtual knockout 的论文。
可行性分级
| 维度 | 判断 | 说明 |
|---|---|---|
| 主题新颖性 | 高 | 方法学快速更新,2026 年已出现 TxPert 和系统比较研究;乳腺癌应用仍可做专题化梳理。 |
| 数据可得性 | 中-高 | WoS/Scopus/PubMed 可检索;但术语分散,必须用概念块检索并人工筛选。 |
| 文献量 | 中 | 直接短语命中会偏少;扩大到 computational perturbation、CRISPR screen、Perturb-seq、GRN 后才有稳定语料。 |
| 计量方法适配 | 高 | 年发文、国家/机构、共被引、关键词共现、主题演化、突发词均适用。 |
| 生物学解释风险 | 中-高 | 计量结果只能说明知识结构和热点,不能证明某个虚拟敲除靶点有效。 |
| 青基选题潜力 | 中-高 | 适合做“方法演化 + 乳腺癌场景缺口 + 可验证候选”的交叉切口。 |
为什么直接短语会漏文献
乳腺癌论文常用的表述可能是:in silico perturbation、gene perturbation prediction、virtual knockout/knockdown、CRISPR screen、Perturb-seq、gene regulatory network、counterfactual cell state、drug perturbation。因此必须把“方法词”和“疾病词”拆成检索块。
建议的研究问题
主问题
2016–2026 年乳腺癌计算基因扰动研究的知识结构、技术演化、核心机构与未来主题是什么?
子问题
- 乳腺癌计算扰动研究的发文和被引增长从哪一年开始?是否存在 2023 年后由生成式/基础模型驱动的主题跃迁?
- ER+、HER2+、TNBC、耐药、转移、肿瘤微环境和单细胞扰动之间的共现结构如何?
- 哪些方法(GRN 模拟、生成式模型、知识图谱、基础模型)在乳腺癌文献中真正落地,哪些仍停留在通用 benchmark?
- 中国机构在该主题中的合作网络和主题优势是什么?
推荐检索式
Web of Science Core Collection
TS=((breast neoplasm* OR breast cancer* OR mammary carcinoma* OR triple-negative breast cancer* OR TNBC)
AND
("in silico perturb*" OR "virtual knockout" OR "virtual knockdown" OR "gene perturbation prediction"
OR Perturb-seq OR CRISPR screen* OR "single-cell perturb*" OR "gene regulatory network*"
OR CellOracle OR scTenifoldKnk OR GEARS OR TxPert OR scGen OR Geneformer OR scGPT))
建议时间范围:2016-01-01 至 2026-09-15;文献类型:Article、Review、Proceedings Paper;语言先不限制,后续分层。
Scopus
TITLE-ABS-KEY(("breast cancer" OR "breast neoplasm" OR TNBC)
AND ("in silico perturbation" OR "virtual knockout" OR "virtual knockdown"
OR "Perturb-seq" OR "CRISPR screen" OR "single-cell perturbation"
OR "gene regulatory network" OR GEARS OR TxPert OR scGen))
PubMed 补充式
((breast neoplasms[MeSH Terms] OR breast cancer*[Title/Abstract] OR TNBC[Title/Abstract])
AND (perturb*[Title/Abstract] OR knockout[Title/Abstract] OR knockdown[Title/Abstract]
OR Perturb-seq[Title/Abstract] OR CRISPR[Title/Abstract]
OR "gene regulatory network"[Title/Abstract] OR in silico[Title/Abstract]))
纳入与排除
纳入
- 研究对象包含乳腺癌细胞、患者样本、乳腺癌类器官/模型,或结果明确回到乳腺癌场景。
- 使用计算扰动、虚拟敲除/敲低、CRISPR/Perturb-seq 读出建模、GRN 扰动或扰动响应预测。
- 原始研究、方法研究、综述可分别建库;不要在同一网络中混合而不标记。
排除
- 只做普通差异表达、预后模型、免疫浸润或药物敏感性,而没有明确扰动/反事实步骤。
- 只在非乳腺癌细胞中 benchmark,且没有乳腺癌应用或讨论。
- 仅有新闻、摘要、重复记录;预印本保留但单独标记。
建议分析包
- 描述统计:年度发文、被引、期刊、国家、机构、作者。
- 科学合作:国家/机构/作者合作网络,计算网络密度和中心性。
- 知识基础:共被引作者、共被引文献、文献耦合。
- 主题结构:作者关键词共现、主题聚类、时间叠加图、突发词。
- 方法演化:把每篇论文编码为
真实扰动 / GRN模拟 / 生成式 / 图知识 / 基础模型五类。 - 乳腺癌场景层:
亚型 / 耐药 / 转移 / 微环境 / 干性 / 免疫 / 空间。 - 稳健性:WoS 与 Scopus 交叉去重;对检索式做窄、中、宽三档敏感性分析。
推荐题目
最稳妥
乳腺癌计算基因扰动研究的知识结构与技术演化:基于 Web of Science 的文献计量与主题分析(2016–2026)
更有方法学特色
从 Perturb-seq 到知识图谱基础模型:乳腺癌虚拟敲除研究的十年演化与转化缺口
更贴近青基
乳腺癌单细胞计算扰动的技术谱系、亚型偏倚与可验证靶点优先级:文献计量结合多队列证据整合
关键风险与应对
- 术语漂移:用同义词词典和人工双人筛选;保留检索日志。
- 方法与应用混杂:通用方法论文和乳腺癌应用论文分层,不直接合并结论。
- 引用优势偏倚:同时报告总被引、年均被引和近三年被引。
- 中文/英文数据库差异:CNKI 可作为补充,不与 WoS 记录直接混合统计。
- 虚拟预测被误读为因果证据:结果章节单列“预测证据”和“实验验证证据”。
最小可行项目(MVP)
- 导出 WoS 全记录及 cited references,预计先筛 200–800 条候选记录。
- 用标题/摘要人工编码 100 条,建立术语词典和排除规则。
- 用 VOSviewer 做关键词共现、共被引和国家/机构合作图。
- 用 bibliometrix/Biblioshiny 做主题演化和三字段图。
- 对 20–40 篇核心乳腺癌应用论文做方法—数据—验证矩阵。
- 最终把文献计量结果与乳腺癌单细胞数据中的候选靶点验证路线连接起来。
当前判断
这个方向适合做“方法学热点与应用缺口”的文献计量,不适合仅凭文献计量直接宣称某个基因是乳腺癌治疗靶点。最有发表潜力的组合是:计量学绘制技术谱系 + 乳腺癌分层应用审计 + 公共单细胞队列中的可复现验证。
Comments NOTHING