单细胞RNA测序技术的成熟使得研究者能够以前所未有的分辨率观察单个细胞的转录组全貌,从而揭示细胞异质性、鉴定稀有细胞类型、追踪细胞发育轨迹。然而,单细胞RNA测序(scRNA-seq)让我们能够在单个细胞的精度上观察基因表达,但"进去的是垃圾,出来的也是垃圾"——如果没有严格的质量控制,再昂贵的测序数据也可能得出错误结论。低质量数据到底是怎么产生的? 如果我们只是机械地执行"过滤高线粒体基因细胞"这样的操作,却不理解这些细胞为什么线粒体基因高,就容易犯两种错误——要么把有生物学意义的细胞当垃圾扔掉,要么留下了看起来正常但实际上不可靠的细胞。下面我们从单细胞实验的完整流程出发,逐一讲解数据噪音的来源、它们在数据中的表现形态,以及如何应对。
在组织解离(dissociation)、细胞捕获(capture)或裂解(lysis)过程中,机械剪切力、酶消化和渗透压变化会对细胞造成物理和化学压力。部分细胞在这个过程中受损或死亡,细胞膜破裂,胞质中的mRNA泄漏到细胞外溶液中,形成环境RNA(ambient RNA),它们在单细胞分离过程中游离于溶液中,可能随目标细胞一同被捕获进入液滴或微孔,导致一个细胞的表达谱中混入了其他细胞的转录本。但线粒体由于具有双层膜结构,其内部的mRNA相对更稳定,不易降解。结果是:测序仪读到的这个"细胞",实际上只剩下了线粒体中的RNA,它已经不是一个完整的活细胞了。
这一过程串联起来就是:
组织解离 → 机械/酶学损伤 → 细胞膜完整性丧失 → 胞质mRNA泄漏 → 仅剩线粒体mRNA等稳定RNA被捕获 → 测序得到"细胞残骸"的数据
此外,还有两种特定于实验方案的交叉污染来源:
环境RNA污染最典型的信号是:
在基于液滴(droplet)的微流控平台(如10x Genomics)中,细胞悬液和barcode标记的凝胶珠(bead)被注入微流控芯片,经油相剪切形成一个个独立的液滴反应器。理想情况下,每个液滴恰好包含一个细胞和一个凝胶珠。但现实受制于技术条件细胞进入液滴是一个随机过程,必然导致:
当目标细胞加载量增大时,doublet比例显著上升。10x Genomics官方数据显示:加载7000个细胞时doublet率约5.4%,加载10000个时升至7.6%。这是一个统计学约束,无法通过优化实验条件完全消除。
此外,基于微孔(microwell)的平台(如BD Rhapsody)通过自动显微镜检查来过滤多细胞孔,能显著降低multiplet率,但也无法完全消除。
空滴:
Doublet/Multiplet:
单细胞中的mRNA总量仅为皮克级(约10-30 pg),这意味着必须通过反转录(RT)和PCR扩增才能获得足够上机的cDNA量。但这个过程中存在三重偏差:
这些偏差的直接后果是:即使一个基因在细胞中确实有表达,也可能因为RT/PCR效率低而在最终数据中显示为0——这就是dropout现象。scRNA-seq数据中超过90%的矩阵元素为0,其中相当一部分是技术性dropout而非真正的不表达。
单细胞实验通常涉及多个样本,这些样本可能在不同的日期、由不同的操作者、使用不同批次的试剂、在不同的测序lane上完成。这些看似微小的差异在单细胞分辨率下会被放大,导致即使是同一细胞类型,在不同批次间也会出现系统性的表达偏移。这就是批次效应(batch effect)。
批次效应的本质是:技术变量与生物学变量发生了混淆。举例来说,如果你所有疾病组样本都是在周一处理的,所有对照组样本都是在周三处理的,那么你无法区分观察到的差异是疾病vs对照的生物学差异,还是"周一试剂新鲜vs周三试剂轻微降解"的技术差异。
可以使用一些批次效应整合工具解决:
场景特征推荐工具原理批次与生物结构分明、任务简单Harmony[24]通过模糊聚类迭代校正,快速且对简单场景效果很好组织/器官图谱级别复杂整合scVI[25]深度生成模型,能建模复杂的技术-生物交互效应数据规模大、关注运行效率BBKNN[26]在k近邻图构建阶段就进行批次平衡,内存和时间效率高
关键注意事项——过度校正的危害:
在肿瘤样本等高度异质性的样本中,不同患者的肿瘤在生物学上就应该是不同的。如果你"强行"将所有样本拉到一起,可能会抹去肿瘤亚克隆的真实生物学差异。Wu等人[7](2021)在非小细胞肺癌研究中就观察到这一现象。因此,校正后务必用已知的细胞类型标记基因验证生物学信号是否被保留——这是判断校正程度是否合适的最直接方法。
这是噪音来源之外最容易被忽视、但影响最深远的质控维度。 前几个来源处理的是"细胞已经死了/破了/被污染了"的问题——这些是终末状态。而细胞应激反应处理的是另一个更微妙的问题:细胞还活着,但它的转录组已经因为实验操作而偏离了体内真实状态。
当细胞经历组织解离、FACS分选、温度变化、渗透压波动等实验操作时,即使这些操作不足以杀死细胞,也足以触发一系列细胞内信号级联反应,导致数百个基因的表达在几分钟到几十分钟内发生剧烈变化。问题是:这些变化不是你想研究的生物学过程的一部分——它们是实验操作的人为产物。
这一现象的发现来自 van den Brink等人[8](2017)在 Nature Methods 上发表的 Correspondence。他们在对肌肉干细胞(satellite cells)进行scRNA-seq分析时,发现一个由 Fos、Jun(AP-1转录因子家族)和热休克蛋白基因组成的基因集在部分细胞中被强烈诱导。关键证据是:通过显微镜观察,这些基因在未解离的完整组织中的同一细胞类型中并不表达。这意味着——细胞将"被解离出来"这件事误读为"组织受伤了",并启动了损伤应答程序。更深远的是,这一应激特征随后在胰腺、斑马鱼鳍等多个独立数据集中被反复验证,说明它是组织解离的通用性人为产物,而非肌肉组织的特例。
这一发现引发了领域内的系统性反思。Marsh等人[9](2022)在 Nature Neuroscience 上进一步揭示,在小鼠和人脑组织的酶解过程中,小胶质细胞(microglia)会获得一种人为的"激活"状态——表达 Fos、Jun、Hspa1a、Dusp1 以及 Ccl3、Ccl4 等免疫信号基因。这种被他们称为"ex vivo activated microglia"(exAM)的人为特征,在此前发表的文献中广泛存在,且被错误地解读为疾病相关的神经炎症信号。更令人警醒的是,在死后人脑的单细胞核测序数据中,他们也发现了类似的信号——其强度与死亡后处理时间(postmortem interval)相关,提示这可能混淆了生前疾病状态与死后变化的解读。
并非所有的细胞应激都是一样的。不同的实验操作会触发不同的应激通路。Utkina等人[10](2024)在 Frontiers in Cell and Developmental Biology 上发表的研究将解离诱导的应激反应系统性地分为五大模态(modality),每种都有对应的标志基因集合:
应激模态关键标志基因触发因素氧化应激(Oxidative Stress)NFE2L2, KEAP1, SOD1, CAT, HMOX1, GCLC, GCLM, NQO1, PRDX1组织解离过程中活性氧(ROS)的突然增加;从体内低氧环境转移到体外常氧环境细胞衰老(Cellular Senescence)CDKN1A (p21), CDKN2A (p16), IGFBP3, GADD45A, IL1A, IL1B, IL6, HMGA1, HMGB2长时间的酶解消化、常温处理导致的细胞损伤积累DNA损伤应答(DNA Damage)TP53, BRCA1, CHEK2, ATM, RAD51, RPA1, MDM2, ATR, XRCC5机械剪切力、酶解过程中的非特异性核酸酶活性热休克反应(Heat Shock)HSPA1A, HSPA1B, HSPA5 (BiP), HSPA8, HSP90AA1, HSP90AB1, HSP90B1, HSPB1, HSPH1 等30+个HSP家族成员解离和FACS过程中的温度波动(37°C→4°C→室温的反复切换)未折叠蛋白反应(UPR)ATF4, ATF6, XBP1, HSPA5 (BiP), DDIT3 (CHOP), HERPUD1, DNAJC3, ERN1 (IRE1), PDIA6内质网应激,常与氧化应激和热休克协同发生
这一分类的重要启示是:不同类型的应激需要不同的对策。 热休克可以通过低温操作来减少(见下文),但氧化应激可能需要添加抗氧化剂。而DNA损伤应答一旦触发,即使细胞存活,其转录组也已经无法代表体内状态——这类细胞的最佳处理方式是识别并移除,而非"保留但回归掉"。
在单细胞数据中识别应激细胞,传统上依赖间接指标(如高%Mito),但正如Gruffi算法开发者所指出的:高%Mito过滤并不同步富集应激细胞,因为缺氧应激不必然导致线粒体损伤;低UMI过滤虽然能富集到部分应激细胞,但会同时偏倚地去除特定细胞类型。
以下是目前领域内主要的应激检测方法,按发表时间排列:
方法一:应激基因评分法(Stress Gene Scoring)
这是最直接且最广泛应用的方法。核心思路是:选取已知的应激相关基因集合,对每个细胞计算一个"应激分数"(通常是这些基因的平均表达值或模块分数),然后根据分数的分布设定过滤阈值。
方法二:Gruffi——基于功能粒度的无偏应激检测
Vértesy等人[11](2022)在 The EMBO Journal 上发表了 Gruffi(Granular Functional Filtering)算法。这是目前最系统化的应激细胞识别工具。在约19万个脑类器官细胞的测试中,Gruffi去除了约13%的应激细胞,使得类器官的发育轨迹更接近体内胎儿脑数据。该算法已发布为R包并附带交互式Shiny App,此外在视网膜类器官中也验证了其通用性。
方法三:SLAM-seq——直接测量解离过程中的新生转录
Neuschulz等人[13](2023)在 Molecular Systems Biology 上提出了一种根本性的方法学突破——不是事后识别应激,而是直接测量解离过程中细胞转录组发生了什么变化。
SLAM-seq不仅证实了应激转录本确实是在解离过程中新合成的(而非解离后RNA稳定性差异造成的假象),更重要的是,它可以用来优化解离方案——比较4°C vs 37°C条件下应激信号的强度,从而选择应激最小的实验条件。
方法四:scQCenrich——多维度QC的整合框架
Liu等人[14](2026)在 Communications Biology 上发表了 scQCenrich,将应激特征整合进一个多指标QC框架。除了传统的%Mito、nGene、nUMI外,scQCenrich还纳入了内含子比例、MALAT1富集度、解离应激特征等额外维度,并提供自动化报告系统。其关键优势在于:相比传统固定阈值方法或miQC等模型化方法,减少了过度过滤,更好地保留了神经元、心肌细胞、红系细胞等具有特殊QC特征的细胞群体。
即使实验设计已经优化,一定程度的应激信号仍然难以完全避免。在数据分析阶段,面对检测到的应激信号,有三种基本策略可供选择:
策略A:直接过滤应激细胞
适用场景:应激细胞占比不大(<20%),且应激分数与细胞类型无强相关性。
具体做法:使用Gruffi或应激基因评分法识别应激细胞后直接移除。关键注意事项——必须检查移除前后的细胞类型组成。如果移除应激细胞后某个细胞类型比例显著下降(例如从15%降到5%),则该细胞类型可能天然对应激通路有更高基线活性,需要调整应激阈值或考虑策略B。
策略B:回归掉应激分数(Regression out)
适用场景:应激信号广泛存在于多种细胞类型中,直接过滤会导致样本量大幅减少。
具体做法:在Seurat的 SCTransform() 或 ScaleData() 中将应激分数作为协变量回归掉(vars.to.regress = c("stress.score"))。关键注意事项——作者在原文中郑重警告:应激基因的表达有时恰恰反映了真实的生物学响应或疾病状态。 例如,在缺血性肾损伤模型中,热休克蛋白和FOS/JUN的诱导本身就是疾病过程的一部分。此时回归掉应激信号等同于抹去关键的生物学发现。
参考文献:https://www.cell.com/cancer-cell/fulltext/S1535-6108(25)00025-X
策略C:保留但做敏感性分析
适用场景:无法确定应激信号是技术性还是生物学性时。
具体做法:分别运行"含应激处理"和"不含应激处理"两个版本的分析流程,比较两次分析的关键结论是否一致。如果主要结果在两个版本中一致(例如相同的差异基因、相同的细胞类型比例趋势),则结论对应激处理是稳健的。如果结果不一致,需要深入探究不一致的原因,并在论文中透明报告。
[1] Osorio D, Cai JJ. Systematic determination of the mitochondrial proportion in human and mice tissues for single-cell RNA-sequencing data quality control. Bioinformatics. 2021;37(7):963-967. DOI: 10.1093/bioinformatics/btaa751.
[2] Uhlén M, Fagerberg L, Hallström BM, et al. Tissue-based map of the human proteome. Science. 2015;347(6220):1260419. DOI: 10.1126/science.1260419.
[3] Park J, Shrestha R, Qiu C, et al. Single-cell transcriptomics of the mouse kidney reveals potential cellular targets of kidney disease. Science. 2018;360(6390):758-763. DOI: 10.1126/science.aar2131.
[4] Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biology. 2019;20:296. DOI: 10.1186/s13059-019-1874-1.
[5] Fleming SJ, Chaffin MD, Arduini A, et al. Unsupervised removal of systematic background noise from droplet-based single-cell experiments using CellBender. Nature Methods. 2023;20:1323-1335. DOI: 10.1038/s41592-023-01943-7.
[6] Janssen P, Kliesmete Z, Vieth B, et al. The effect of background noise and its removal on the analysis of single-cell expression data. Genome Biology. 2023;24:140. DOI: 10.1186/s13059-023-02978-x.
[7] Wu F, Fan J, He Y, et al. Single-cell profiling of tumor heterogeneity and the microenvironment in advanced non-small cell lung cancer. Nature Communications. 2021;12:2540. DOI: 10.1038/s41467-021-22801-0.
[8] van den Brink SC, Sage F, Vértesy Á, et al. Single-cell sequencing reveals dissociation-induced gene expression in tissue subpopulations. Nature Methods. 2017;14:935-936. DOI: 10.1038/nmeth.4437.
[9] Marsh SE, Walker AJ, Kamath T, et al. Dissection of artifactual and confounding glial signatures by single-cell sequencing of mouse and human brain. Nature Neuroscience. 2022;25(3):306-316. DOI: 10.1038/s41593-022-01022-8.
[10] Utkina M, Shcherbakova A, Deviatiiarov R, et al. Comparative evaluation of ACetic-MEthanol high salt dissociation approach for single-cell transcriptomics of frozen human tissues. Frontiers in Cell and Developmental Biology. 2025;12:1469955. DOI: 10.3389/fcell.2024.1469955.
[11] Vértesy Á, Eichmüller OL, Naas J, et al. Gruffi: an algorithm for computational removal of stressed cells from brain organoid transcriptomic datasets. The EMBO Journal. 2022;41(17):e111118. DOI: 10.15252/embj.2022111118.
[12] Subramanian A, Alperovich M, Yang Y, Li B. Biology-inspired data-driven quality control for scientific discovery in single-cell transcriptomics. Genome Biology. 2022;23:267. DOI: 10.1186/s13059-022-02820-w.
[13] Neuschulz A, Bakina O, Badillo-Lisakowski V, et al. A single-cell RNA labeling strategy for measuring stress response upon tissue dissociation. Molecular Systems Biology. 2023;19(2):e11147. DOI: 10.15252/msb.202211147.
[14] Liu K, et al. scQCenrich enables multi-metric quality control for single-cell RNA sequencing. Communications Biology. 2026. DOI: 10.1038/s42003-026-10382-x.
[15] Jiménez-Gracia L, et al. FixNCut: single-cell genomics through reversible tissue fixation and dissociation. Genome Biology. 2024;25:81. DOI: 10.1186/s13059-024-03219-5.
[16] Gharaie S, Lee K, Noller K, et al. Single cell and spatial transcriptomics analysis of kidney double negative T lymphocytes in normal and ischemic mouse kidneys. Scientific Reports. 2023;13:20888. DOI: 10.1038/s41598-023-48213-2.
[17] Kunes RZ, Walle T, Land M, Nawy T, Pe’er D. Supervised discovery of interpretable gene programs from single-cell data. Nature Biotechnology. 2024;42:1084-1095. DOI: 10.1038/s41587-023-01940-3.
[18] Karademir D, Todorova V, Ebner LJA, Samardzija M, Grimm C. Single-cell RNA sequencing of the retina in a model of retinitis pigmentosa reveals early responses to degeneration in rods and cones. BMC Biology. 2022;20:86. DOI: 10.1186/s12915-022-01280-9.
[20] Lun ATL, McCarthy DJ, Marioni JC. A step-by-step workflow for low-level analysis of single-cell RNA-seq data with Bioconductor. F1000Research. 2016;5:2122. DOI: 10.12688/f1000research.9501.2.
[21] Wolock SL, Lopez R, Klein AM. Scrublet: computational identification of cell doublets in single-cell transcriptomic data. Cell Systems. 2019;8(4):281-291.e9. DOI: 10.1016/j.cels.2018.11.005.
[23] McGinnis CS, Murrow LM, Gartner ZJ. DoubletFinder: doublet detection in single-cell RNA sequencing data using artificial nearest neighbors. Cell Systems. 2019;8(4):329-337.e4. DOI: 10.1016/j.cels.2019.03.003.
[24] Korsunsky I, Millard N, Fan J, et al. Fast, sensitive and accurate integration of single-cell data with Harmony. Nature Methods. 2019;16:1289-1296. DOI: 10.1038/s41592-019-0619-0.
[25] Lopez R, Regier J, Cole MB, Jordan MI, Yosef N. Deep generative modeling for single-cell transcriptomics. Nature Methods. 2018;15:1053-1058. DOI: 10.1038/s41592-018-0229-2.
[26] Polański K, Young MD, Miao Z, Meyer KB, Teichmann SA, Park JE. BBKNN: fast batch alignment of single cell transcriptomes. Bioinformatics. 2020;36(3):964-965. DOI: 10.1093/bioinformatics/btz625.
[28] Luecken MD, Büttner M, Chaichoompu K, et al. Benchmarking atlas-level data integration in single-cell genomics. Nature Methods. 2022;19:41-50. DOI: 10.1038/s41592-021-01336-8.
[30] Pasquini G, Arias JER, Schäfer P, Busskamp V. Automated methods for cell type annotation on scRNA-seq data. Computational and Structural Biotechnology Journal. 2021;19:961-969. DOI: 10.1016/j.csbj.2021.01.015.
[32] Kim H, Chang W, Chae SJ, Park JE, Seo M, Kim JK. scLENS: data-driven signal detection for unbiased scRNA-seq data analysis. Nature Communications. 2024;15:3575. DOI: 10.1038/s41467-024-47884-3.
[38] Yang S, Corbett SE, Koga Y, et al. Decontamination of ambient RNA in single-cell RNA-seq with DecontX. Genome Biology. 2020;21:57. DOI: 10.1186/s13059-020-1950-6.
[40] Smillie CS, Biton M, Ordovas-Montanes J, et al. Intra- and inter-cellular rewiring of the human colon during ulcerative colitis. Cell. 2019;178(3):714-730.e22. DOI: 10.1016/j.cell.2019.06.029.
[46] 10x Genomics. Chromium Single Cell 3’ Reagent Kits User Guide (v3.1 Chemistry). 2022. https://www.10xgenomics.com/support/single-cell-gene-expression/documentation/steps/library-prep/chromium-single-cell-3-reagent-kits-user-guide-v-3-1-chemistry.
生信课堂做了市场上专门为单细胞转录组分析打造的云服务器。让大家直接上手跑,省的装包装来装去。现在大家可以免费领取使用了;
考虑到有些同学想跑大数据分析,由于是共享免费服务器会对资源做一些限制以免影响他人使用,大家可以错峰使用(账号和存储都是独立的,不用担心别人看到你的数据);资源有限,大家分析完请及时清空和导出,以便让更多人使用。
也考虑到有些同学是初学者,我们也准备了linux和R语言基础课程及单细胞基础课,下面两门课中也有AI大模型讲解应用学习生信更高效,大家可以免费学习:
Linux入门课:https://bdtcd.xetslk.com/s/4dqHvY
R语言入门课:https://bdtcd.xetslk.com/s/4GwPsn
单细胞视频课程:https://bdtcd.xetslk.com/s/1NIpoo
提示
怎么领免费云服务器, 关注生信课堂公众号后台私信:单细胞云服务器+邮箱 ,(一定要输入完整邮箱避免收不到邮件)即可获取账号和登录方法:
领取方法
单细胞转录组的代码放到免费的公共共享服务器中了我们会逐步把测试好的代码,放到公共文件夹下,让大家无障碍运行,打开就能看到, 既有模式物种小鼠,也有非模式物种玉米根的数据示例,方便大家分析数据。
单细胞分析示例代码运行效果图
生信课堂团队提供生信便捷式“云服务器”、“单细胞转录组数据分析服务”、“生信学习班”以及“生信交流群”等内容,有需要者可以扫描下方微信二维码咨询,并加讨论群领取学习资料:
欢迎扫描咨询
如果觉得我的文章对您有用,请随意打赏。你的支持将鼓励我继续创作!
