单细胞RNA测序的质量控制详解:一份为初学者准备的质控手册

单细胞RNA测序的质量控制详解:一份为初学者准备的质控手册

移步微信公众号文章:https://mp.weixin.qq.com/s/DYCYZ_t25TV8LlYX_szebw


单细胞RNA测序的质量控制详解:一份为初学者准备的质控手册

导语

单细胞RNA测序技术的成熟使得研究者能够以前所未有的分辨率观察单个细胞的转录组全貌,从而揭示细胞异质性、鉴定稀有细胞类型、追踪细胞发育轨迹。然而,单细胞RNA测序(scRNA-seq)让我们能够在单个细胞的精度上观察基因表达,但"进去的是垃圾,出来的也是垃圾"——如果没有严格的质量控制,再昂贵的测序数据也可能得出错误结论。低质量数据到底是怎么产生的? 如果我们只是机械地执行"过滤高线粒体基因细胞"这样的操作,却不理解这些细胞为什么线粒体基因高,就容易犯两种错误——要么把有生物学意义的细胞当垃圾扔掉,要么留下了看起来正常但实际上不可靠的细胞。下面我们从单细胞实验的完整流程出发,逐一讲解数据噪音的来源、它们在数据中的表现形态,以及如何应对。

640?wx_fmt=png&from=appmsg

来源一:细胞死亡与膜完整性丧失——线粒体基因占比升高的根本原因

在组织解离(dissociation)、细胞捕获(capture)或裂解(lysis)过程中,机械剪切力、酶消化和渗透压变化会对细胞造成物理和化学压力。部分细胞在这个过程中受损或死亡,细胞膜破裂,胞质中的mRNA泄漏到细胞外溶液中,形成环境RNA(ambient RNA),它们在单细胞分离过程中游离于溶液中,可能随目标细胞一同被捕获进入液滴或微孔,导致一个细胞的表达谱中混入了其他细胞的转录本。但线粒体由于具有双层膜结构,其内部的mRNA相对更稳定,不易降解。结果是:测序仪读到的这个"细胞",实际上只剩下了线粒体中的RNA,它已经不是一个完整的活细胞了。

这一过程串联起来就是:

组织解离 → 机械/酶学损伤 → 细胞膜完整性丧失 → 胞质mRNA泄漏 → 仅剩线粒体mRNA等稳定RNA被捕获 → 测序得到"细胞残骸"的数据

此外,还有两种特定于实验方案的交叉污染来源:

  • Barcode交换:在测序的cluster generation阶段,不同细胞来源的cDNA分子可能与相邻的barcode发生错误结合,导致"张冠李戴"
  • 边缘蒸发效应(仅基于孔板的方案):96孔或384孔板边缘的孔蒸发更快,可能引起相邻孔之间的试剂交叉污染

数据上如何识别?

  • • 线粒体阈值过滤:通常设置%Mito < 5%-20%作为过滤标准,但阈值不是绝对的。
  • 关键注意事项(极易出错的地方)
    • 不同物种基线不同:人源样本的线粒体基因占比通常高于小鼠样本[1]。
    • 不同组织基线不同:肾脏、心脏等高代谢活性组织的线粒体基因天然高表达。如果你用肝脏的阈值(如5%)去过滤肾脏数据,可能误杀大量正常的肾小管上皮细胞[2]。
    • 阈值应基于数据本身的分布设定:观察自己数据的Violin Plot中%Mito的分布拐点,而不是照搬文献中的数字。如果主体细胞群的%Mito中位数是8%,那么阈值设在15%左右(约中位数的2倍)是合理的;如果中位数已经是15%,阈值需相应提高。
    • 不要只用%Mito一个维度做判断:对%Mito偏高但nGene和nUMI正常的细胞,需结合生物学背景谨慎评估——它们可能是代谢活跃的细胞,而不是死细胞。

环境RNA污染最典型的信号是:

  • 一种细胞类型"表达"了另一种细胞类型的特异性标记基因,且这种"表达"与已知的生物学模式矛盾。例如,T细胞cluster中出现肾小管上皮细胞的标记基因表达,这在生理上是不可能的(除非组织样本来自肾脏且细胞间存在真实互作)。
  • 来自组织中高丰度细胞类型的标记基因在几乎所有细胞中都有低水平信号:例如在肺组织中,如果上皮细胞标记基因在几乎所有免疫细胞中都有微弱的表达信号,且信号强度与UMI深度相关(UMI越高的细胞信号越强),则高度提示环境RNA污染。
  • nGene/nUMI比率异常:环境RNA污染会导致nGene相对于nUMI异常升高(因为额外捕获了微弱的环境RNA信号,但每个基因的计数很少)。

解决策略

  • CellBender:基于无监督深度学习方法,在不需要用户输入marker基因的情况下估计并移除系统背景噪音,在benchmark中表现最优[5]。
  • SoupX:需要用户提供已知的marker基因作为先验知识,对于单细胞核数据(snRNA-seq)效果更好[6]。
  • DecontX[38]:基于贝叶斯模型的去污染方法,可同时估计每个细胞的污染比例。
  • 关键注意事项
    • ◦ 去除ambient RNA应该在细胞过滤之前进行,因为污染的存在会改变你对"好细胞"的判断标准。
    • ◦ 不要过度追求"纯净"——微弱的背景信号去除后注意验证,已知的生物学marker表达模式是否仍符合预期。

来源二:空滴与多细胞捕获doublet

在基于液滴(droplet)的微流控平台(如10x Genomics)中,细胞悬液和barcode标记的凝胶珠(bead)被注入微流控芯片,经油相剪切形成一个个独立的液滴反应器。理想情况下,每个液滴恰好包含一个细胞和一个凝胶珠。但现实受制于技术条件细胞进入液滴是一个随机过程,必然导致:

  • 大部分液滴是空的(约90%以上):没有细胞,只有背景溶液
  • 少数液滴恰好有一个细胞和一个bead:这是我们想要的有效数据
  • 极少液滴包含两个或更多细胞:即doublet或multiplet事件
  • 640?wx_fmt=png&from=appmsg640?wx_fmt=png&from=appmsg

当目标细胞加载量增大时,doublet比例显著上升。10x Genomics官方数据显示:加载7000个细胞时doublet率约5.4%,加载10000个时升至7.6%。这是一个统计学约束,无法通过优化实验条件完全消除。

此外,基于微孔(microwell)的平台(如BD Rhapsody)通过自动显微镜检查来过滤多细胞孔,能显著降低multiplet率,但也无法完全消除。

数据上如何识别?

空滴

  • • nUMI极低(通常 < 500-1000)
  • • nGene极低
  • • 在Barcode Rank Plot(barcode按UMI总量降序排列的曲线图)上,空滴对应曲线末端的"膝盖"(knee)以下的灰色区:
  • 640?wx_fmt=png&from=appmsg

Doublet/Multiplet

  • • nUMI和nGene异常偏高(约为中位数的2倍以上)
  • • 共表达两种互斥细胞谱系的标记基因(如一个"细胞"同时高表达T细胞marker CD3E和B细胞marker MS4A1/CD20)
  • • 在UMAP/t-SNE图上可能形成介于两种细胞类型之间的"中间"cluster

解决策略

  • 空滴:通过nUMI阈值过滤。常用方法是绘制Barcode Rank Plot,以曲线拐点(knee point)或拐点以下(inflection point)作为截止阈值。CellRanger[46]等官方软件会自动进行此步。
  • Doublet:先用Scrublet[21](速度快,适合大规模数据)或DoubletFinder[23](准确性更高)进行自动化预测,再对共表达互斥谱系marker的细胞进行人工审查。
  • 关键注意事项:共表达两个细胞类型marker的细胞不一定是doublet。上皮-间质转化(EMT)过程中的过渡态细胞会同时表达上皮和间质marker。Park等人[3](2018)在肾脏单细胞研究中就保留了这类共表达细胞作为真实的过渡态。算法给出的是概率,最终判断需要生物学知识的校准。

来源三:反转录与扩增偏差——数据稀疏性的技术根源

发生了什么?

单细胞中的mRNA总量仅为皮克级(约10-30 pg),这意味着必须通过反转录(RT)和PCR扩增才能获得足够上机的cDNA量。但这个过程中存在三重偏差:

  1. 1. 反转录效率差异:不同转录本的GC含量、二级结构和长度不同,导致RT引物的结合效率不同。GC含量极高或极低的转录本、具有复杂二级结构的转录本,RT效率显著降低。
  2. 2. PCR扩增偏好:PCR对GC含量和片段长度有固有的扩增偏好性——中等GC含量、较短片段的转录本更容易被扩增。
  3. 3. 3’端偏差:大多数scRNA-seq方案(如10x Genomics的3’端测序)只能捕获转录本的3’末端。如果一个基因的3’末端区域恰好有不利的序列特征,该基因的表达可能被系统性低估。

这些偏差的直接后果是:即使一个基因在细胞中确实有表达,也可能因为RT/PCR效率低而在最终数据中显示为0——这就是dropout现象。scRNA-seq数据中超过90%的矩阵元素为0,其中相当一部分是技术性dropout而非真正的不表达。

数据上如何识别?

  • 数据极度稀疏:典型的10x Genomics数据中,每个细胞检测到约1000-3000个基因(而人类基因组约有20000个蛋白编码基因),即只有5%-15%的基因被检测到
  • 基因检出率与UMI深度高度相关:UMI较低的细胞检测到的基因种类也较少,这不一定反映细胞间的真实生物学差异
  • 在UMI vs nGene散点图上:期望看到两者正相关,偏离对角线的点(nUMI正常但nGene异常少/多)可能是质量问题信号
  • 低表达基因的dropout率显著高于高表达基因:在同一个细胞内,表达量越低的基因越容易被miss

解决策略

  • 使用UMI而非reads计数:UMI(Unique Molecular Identifier)是在扩增前加在每一个cDNA分子上的独特标签,可以消除PCR重复的影响,实现分子级别的计数。
  • 选择合适的归一化方法:sctransform[4](基于正则化负二项回归)比传统的log-normalize能更好地处理稀疏性和方差-均值关系。
  • 640?wx_fmt=png&from=appmsg
  • 关键注意事项:不要用传统bulk RNA-seq的FPKM/RPKM思维理解scRNA-seq数据。单细胞数据中的"0"不等于基因不表达,它可能只是没有被捕获到。对低表达基因的差异分析尤其需要谨慎。

来源四:批次效应——非生物学因素导致的系统性偏移

单细胞实验通常涉及多个样本,这些样本可能在不同的日期、由不同的操作者、使用不同批次的试剂、在不同的测序lane上完成。这些看似微小的差异在单细胞分辨率下会被放大,导致即使是同一细胞类型,在不同批次间也会出现系统性的表达偏移。这就是批次效应(batch effect)。

批次效应的本质是:技术变量与生物学变量发生了混淆。举例来说,如果你所有疾病组样本都是在周一处理的,所有对照组样本都是在周三处理的,那么你无法区分观察到的差异是疾病vs对照的生物学差异,还是"周一试剂新鲜vs周三试剂轻微降解"的技术差异。

数据上如何识别?

  • • 在UMAP/t-SNE图上,同一细胞类型如果按样本来源或处理日期分成了不同的"cluster",而非按生物学分组混在一起,就是典型的批次效应信号.
  • • 基于已知的稳定表达基因(stably expressed genes)检查其在不同批次的表达水平——如果这些本应稳定的基因出现系统性差异,指向技术效应而非生物学差异
  • • 单样本/单batch分析时看不出问题,但合并多个样本后突然出现"新"的cluster——这通常是batch effect创造的假cluster

640?wx_fmt=png&from=appmsg

  • 例如上图,同样的两个样本PBMC(人外周血),左图cluster明显出现对称现象,新的cluster并不是真实的细胞类型,而是由于批次效应导致的,右图很明显两个样本差异;

解决策略

可以使用一些批次效应整合工具解决:

场景特征推荐工具原理批次与生物结构分明、任务简单Harmony[24]通过模糊聚类迭代校正,快速且对简单场景效果很好组织/器官图谱级别复杂整合scVI[25]深度生成模型,能建模复杂的技术-生物交互效应数据规模大、关注运行效率BBKNN[26]在k近邻图构建阶段就进行批次平衡,内存和时间效率高

关键注意事项——过度校正的危害

在肿瘤样本等高度异质性的样本中,不同患者的肿瘤在生物学上就应该是不同的。如果你"强行"将所有样本拉到一起,可能会抹去肿瘤亚克隆的真实生物学差异。Wu等人[7](2021)在非小细胞肺癌研究中就观察到这一现象。因此,校正后务必用已知的细胞类型标记基因验证生物学信号是否被保留——这是判断校正程度是否合适的最直接方法。

来源五:细胞应激反应

这是噪音来源之外最容易被忽视、但影响最深远的质控维度。 前几个来源处理的是"细胞已经死了/破了/被污染了"的问题——这些是终末状态。而细胞应激反应处理的是另一个更微妙的问题:细胞还活着,但它的转录组已经因为实验操作而偏离了体内真实状态。

当细胞经历组织解离、FACS分选、温度变化、渗透压波动等实验操作时,即使这些操作不足以杀死细胞,也足以触发一系列细胞内信号级联反应,导致数百个基因的表达在几分钟到几十分钟内发生剧烈变化。问题是:这些变化不是你想研究的生物学过程的一部分——它们是实验操作的人为产物。

这一现象的发现来自 van den Brink等人[8](2017)在 Nature Methods 上发表的 Correspondence。他们在对肌肉干细胞(satellite cells)进行scRNA-seq分析时,发现一个由 FosJun(AP-1转录因子家族)和热休克蛋白基因组成的基因集在部分细胞中被强烈诱导。关键证据是:通过显微镜观察,这些基因在未解离的完整组织中的同一细胞类型中并不表达。这意味着——细胞将"被解离出来"这件事误读为"组织受伤了",并启动了损伤应答程序。更深远的是,这一应激特征随后在胰腺、斑马鱼鳍等多个独立数据集中被反复验证,说明它是组织解离的通用性人为产物,而非肌肉组织的特例。

这一发现引发了领域内的系统性反思。Marsh等人[9](2022)在 Nature Neuroscience 上进一步揭示,在小鼠和人脑组织的酶解过程中,小胶质细胞(microglia)会获得一种人为的"激活"状态——表达 FosJunHspa1aDusp1 以及 Ccl3Ccl4 等免疫信号基因。这种被他们称为"ex vivo activated microglia"(exAM)的人为特征,在此前发表的文献中广泛存在,且被错误地解读为疾病相关的神经炎症信号。更令人警醒的是,在死后人脑的单细胞核测序数据中,他们也发现了类似的信号——其强度与死亡后处理时间(postmortem interval)相关,提示这可能混淆了生前疾病状态与死后变化的解读。

应激反应的分子分类:不只一种"应激"

并非所有的细胞应激都是一样的。不同的实验操作会触发不同的应激通路。Utkina等人[10](2024)在 Frontiers in Cell and Developmental Biology 上发表的研究将解离诱导的应激反应系统性地分为五大模态(modality),每种都有对应的标志基因集合:

应激模态关键标志基因触发因素氧化应激(Oxidative Stress)NFE2L2, KEAP1, SOD1, CAT, HMOX1, GCLC, GCLM, NQO1, PRDX1组织解离过程中活性氧(ROS)的突然增加;从体内低氧环境转移到体外常氧环境细胞衰老(Cellular Senescence)CDKN1A (p21), CDKN2A (p16), IGFBP3, GADD45A, IL1A, IL1B, IL6, HMGA1, HMGB2长时间的酶解消化、常温处理导致的细胞损伤积累DNA损伤应答(DNA Damage)TP53, BRCA1, CHEK2, ATM, RAD51, RPA1, MDM2, ATR, XRCC5机械剪切力、酶解过程中的非特异性核酸酶活性热休克反应(Heat Shock)HSPA1A, HSPA1B, HSPA5 (BiP), HSPA8, HSP90AA1, HSP90AB1, HSP90B1, HSPB1, HSPH1 等30+个HSP家族成员解离和FACS过程中的温度波动(37°C→4°C→室温的反复切换)未折叠蛋白反应(UPR)ATF4, ATF6, XBP1, HSPA5 (BiP), DDIT3 (CHOP), HERPUD1, DNAJC3, ERN1 (IRE1), PDIA6内质网应激,常与氧化应激和热休克协同发生

这一分类的重要启示是:不同类型的应激需要不同的对策。 热休克可以通过低温操作来减少(见下文),但氧化应激可能需要添加抗氧化剂。而DNA损伤应答一旦触发,即使细胞存活,其转录组也已经无法代表体内状态——这类细胞的最佳处理方式是识别并移除,而非"保留但回归掉"。

如何检测应激细胞:从经验判断到量化评分

在单细胞数据中识别应激细胞,传统上依赖间接指标(如高%Mito),但正如Gruffi算法开发者所指出的:高%Mito过滤并不同步富集应激细胞,因为缺氧应激不必然导致线粒体损伤;低UMI过滤虽然能富集到部分应激细胞,但会同时偏倚地去除特定细胞类型。

以下是目前领域内主要的应激检测方法,按发表时间排列:

方法一:应激基因评分法(Stress Gene Scoring)

这是最直接且最广泛应用的方法。核心思路是:选取已知的应激相关基因集合,对每个细胞计算一个"应激分数"(通常是这些基因的平均表达值或模块分数),然后根据分数的分布设定过滤阈值。

  • van den Brink等人[8](2017, Nature Methods 提供了最初的解离应激基因集,包括 FosJunHspa1aHspa1b 等即时早期基因和热休克基因。在Seurat中,使用 AddModuleScore() 函数即可计算该基因集在每个细胞中的富集分数。
  • Utkina等人[10](2024, Frontiers in Cell and Developmental Biology 将应激基因集从单一列表扩展为五种模态的独立评分体系,使用Wilcoxon秩和检验比较不同解离方案间的应激分数差异。
  • Subramanian等人[12](2022, Genome Biology 开发的 ddqc R包 提出了一种更精细的策略:不是对所有细胞类型使用同一阈值,而是为每种细胞类型单独计算过滤参数,充分考虑不同细胞类型的应激基线差异。

方法二:Gruffi——基于功能粒度的无偏应激检测

Vértesy等人[11](2022)在 The EMBO Journal 上发表了 Gruffi(Granular Functional Filtering)算法。这是目前最系统化的应激细胞识别工具。在约19万个脑类器官细胞的测试中,Gruffi去除了约13%的应激细胞,使得类器官的发育轨迹更接近体内胎儿脑数据。该算法已发布为R包并附带交互式Shiny App,此外在视网膜类器官中也验证了其通用性。

方法三:SLAM-seq——直接测量解离过程中的新生转录

Neuschulz等人[13](2023)在 Molecular Systems Biology 上提出了一种根本性的方法学突破——不是事后识别应激,而是直接测量解离过程中细胞转录组发生了什么变化。

SLAM-seq不仅证实了应激转录本确实是在解离过程中新合成的(而非解离后RNA稳定性差异造成的假象),更重要的是,它可以用来优化解离方案——比较4°C vs 37°C条件下应激信号的强度,从而选择应激最小的实验条件。

方法四:scQCenrich——多维度QC的整合框架

Liu等人[14](2026)在 Communications Biology 上发表了 scQCenrich,将应激特征整合进一个多指标QC框架。除了传统的%Mito、nGene、nUMI外,scQCenrich还纳入了内含子比例、MALAT1富集度、解离应激特征等额外维度,并提供自动化报告系统。其关键优势在于:相比传统固定阈值方法或miQC等模型化方法,减少了过度过滤,更好地保留了神经元、心肌细胞、红系细胞等具有特殊QC特征的细胞群体。

计算层面的移除策略:回归、过滤还是接受?

即使实验设计已经优化,一定程度的应激信号仍然难以完全避免。在数据分析阶段,面对检测到的应激信号,有三种基本策略可供选择:

策略A:直接过滤应激细胞

适用场景:应激细胞占比不大(<20%),且应激分数与细胞类型无强相关性。

具体做法:使用Gruffi或应激基因评分法识别应激细胞后直接移除。关键注意事项——必须检查移除前后的细胞类型组成。如果移除应激细胞后某个细胞类型比例显著下降(例如从15%降到5%),则该细胞类型可能天然对应激通路有更高基线活性,需要调整应激阈值或考虑策略B。

策略B:回归掉应激分数(Regression out)

适用场景:应激信号广泛存在于多种细胞类型中,直接过滤会导致样本量大幅减少。

具体做法:在Seurat的 SCTransform()ScaleData() 中将应激分数作为协变量回归掉(vars.to.regress = c("stress.score"))。关键注意事项——作者在原文中郑重警告:应激基因的表达有时恰恰反映了真实的生物学响应或疾病状态。 例如,在缺血性肾损伤模型中,热休克蛋白和FOS/JUN的诱导本身就是疾病过程的一部分。此时回归掉应激信号等同于抹去关键的生物学发现。

640?wx_fmt=png&from=appmsg

参考文献:https://www.cell.com/cancer-cell/fulltext/S1535-6108(25)00025-X

策略C:保留但做敏感性分析

适用场景:无法确定应激信号是技术性还是生物学性时。

具体做法:分别运行"含应激处理"和"不含应激处理"两个版本的分析流程,比较两次分析的关键结论是否一致。如果主要结果在两个版本中一致(例如相同的差异基因、相同的细胞类型比例趋势),则结论对应激处理是稳健的。如果结果不一致,需要深入探究不一致的原因,并在论文中透明报告。

参考文献

[1] Osorio D, Cai JJ. Systematic determination of the mitochondrial proportion in human and mice tissues for single-cell RNA-sequencing data quality control. Bioinformatics. 2021;37(7):963-967. DOI: 10.1093/bioinformatics/btaa751.

[2] Uhlén M, Fagerberg L, Hallström BM, et al. Tissue-based map of the human proteome. Science. 2015;347(6220):1260419. DOI: 10.1126/science.1260419.

[3] Park J, Shrestha R, Qiu C, et al. Single-cell transcriptomics of the mouse kidney reveals potential cellular targets of kidney disease. Science. 2018;360(6390):758-763. DOI: 10.1126/science.aar2131.

[4] Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biology. 2019;20:296. DOI: 10.1186/s13059-019-1874-1.

[5] Fleming SJ, Chaffin MD, Arduini A, et al. Unsupervised removal of systematic background noise from droplet-based single-cell experiments using CellBender. Nature Methods. 2023;20:1323-1335. DOI: 10.1038/s41592-023-01943-7.

[6] Janssen P, Kliesmete Z, Vieth B, et al. The effect of background noise and its removal on the analysis of single-cell expression data. Genome Biology. 2023;24:140. DOI: 10.1186/s13059-023-02978-x.

[7] Wu F, Fan J, He Y, et al. Single-cell profiling of tumor heterogeneity and the microenvironment in advanced non-small cell lung cancer. Nature Communications. 2021;12:2540. DOI: 10.1038/s41467-021-22801-0.

[8] van den Brink SC, Sage F, Vértesy Á, et al. Single-cell sequencing reveals dissociation-induced gene expression in tissue subpopulations. Nature Methods. 2017;14:935-936. DOI: 10.1038/nmeth.4437.

[9] Marsh SE, Walker AJ, Kamath T, et al. Dissection of artifactual and confounding glial signatures by single-cell sequencing of mouse and human brain. Nature Neuroscience. 2022;25(3):306-316. DOI: 10.1038/s41593-022-01022-8.

[10] Utkina M, Shcherbakova A, Deviatiiarov R, et al. Comparative evaluation of ACetic-MEthanol high salt dissociation approach for single-cell transcriptomics of frozen human tissues. Frontiers in Cell and Developmental Biology. 2025;12:1469955. DOI: 10.3389/fcell.2024.1469955.

[11] Vértesy Á, Eichmüller OL, Naas J, et al. Gruffi: an algorithm for computational removal of stressed cells from brain organoid transcriptomic datasets. The EMBO Journal. 2022;41(17):e111118. DOI: 10.15252/embj.2022111118.

[12] Subramanian A, Alperovich M, Yang Y, Li B. Biology-inspired data-driven quality control for scientific discovery in single-cell transcriptomics. Genome Biology. 2022;23:267. DOI: 10.1186/s13059-022-02820-w.

[13] Neuschulz A, Bakina O, Badillo-Lisakowski V, et al. A single-cell RNA labeling strategy for measuring stress response upon tissue dissociation. Molecular Systems Biology. 2023;19(2):e11147. DOI: 10.15252/msb.202211147.

[14] Liu K, et al. scQCenrich enables multi-metric quality control for single-cell RNA sequencing. Communications Biology. 2026. DOI: 10.1038/s42003-026-10382-x.

[15] Jiménez-Gracia L, et al. FixNCut: single-cell genomics through reversible tissue fixation and dissociation. Genome Biology. 2024;25:81. DOI: 10.1186/s13059-024-03219-5.

[16] Gharaie S, Lee K, Noller K, et al. Single cell and spatial transcriptomics analysis of kidney double negative T lymphocytes in normal and ischemic mouse kidneys. Scientific Reports. 2023;13:20888. DOI: 10.1038/s41598-023-48213-2.

[17] Kunes RZ, Walle T, Land M, Nawy T, Pe’er D. Supervised discovery of interpretable gene programs from single-cell data. Nature Biotechnology. 2024;42:1084-1095. DOI: 10.1038/s41587-023-01940-3.

[18] Karademir D, Todorova V, Ebner LJA, Samardzija M, Grimm C. Single-cell RNA sequencing of the retina in a model of retinitis pigmentosa reveals early responses to degeneration in rods and cones. BMC Biology. 2022;20:86. DOI: 10.1186/s12915-022-01280-9.

[20] Lun ATL, McCarthy DJ, Marioni JC. A step-by-step workflow for low-level analysis of single-cell RNA-seq data with Bioconductor. F1000Research. 2016;5:2122. DOI: 10.12688/f1000research.9501.2.

[21] Wolock SL, Lopez R, Klein AM. Scrublet: computational identification of cell doublets in single-cell transcriptomic data. Cell Systems. 2019;8(4):281-291.e9. DOI: 10.1016/j.cels.2018.11.005.

[23] McGinnis CS, Murrow LM, Gartner ZJ. DoubletFinder: doublet detection in single-cell RNA sequencing data using artificial nearest neighbors. Cell Systems. 2019;8(4):329-337.e4. DOI: 10.1016/j.cels.2019.03.003.

[24] Korsunsky I, Millard N, Fan J, et al. Fast, sensitive and accurate integration of single-cell data with Harmony. Nature Methods. 2019;16:1289-1296. DOI: 10.1038/s41592-019-0619-0.

[25] Lopez R, Regier J, Cole MB, Jordan MI, Yosef N. Deep generative modeling for single-cell transcriptomics. Nature Methods. 2018;15:1053-1058. DOI: 10.1038/s41592-018-0229-2.

[26] Polański K, Young MD, Miao Z, Meyer KB, Teichmann SA, Park JE. BBKNN: fast batch alignment of single cell transcriptomes. Bioinformatics. 2020;36(3):964-965. DOI: 10.1093/bioinformatics/btz625.

[28] Luecken MD, Büttner M, Chaichoompu K, et al. Benchmarking atlas-level data integration in single-cell genomics. Nature Methods. 2022;19:41-50. DOI: 10.1038/s41592-021-01336-8.

[30] Pasquini G, Arias JER, Schäfer P, Busskamp V. Automated methods for cell type annotation on scRNA-seq data. Computational and Structural Biotechnology Journal. 2021;19:961-969. DOI: 10.1016/j.csbj.2021.01.015.

[32] Kim H, Chang W, Chae SJ, Park JE, Seo M, Kim JK. scLENS: data-driven signal detection for unbiased scRNA-seq data analysis. Nature Communications. 2024;15:3575. DOI: 10.1038/s41467-024-47884-3.

[38] Yang S, Corbett SE, Koga Y, et al. Decontamination of ambient RNA in single-cell RNA-seq with DecontX. Genome Biology. 2020;21:57. DOI: 10.1186/s13059-020-1950-6.

[40] Smillie CS, Biton M, Ordovas-Montanes J, et al. Intra- and inter-cellular rewiring of the human colon during ulcerative colitis. Cell. 2019;178(3):714-730.e22. DOI: 10.1016/j.cell.2019.06.029.

[46] 10x Genomics. Chromium Single Cell 3’ Reagent Kits User Guide (v3.1 Chemistry). 2022. https://www.10xgenomics.com/support/single-cell-gene-expression/documentation/steps/library-prep/chromium-single-cell-3-reagent-kits-user-guide-v-3-1-chemistry.

单细胞云服务器免费领取

生信课堂做了市场上专门为单细胞转录组分析打造的云服务器。让大家直接上手跑,省的装包装来装去。现在大家可以免费领取使用了;

考虑到有些同学想跑大数据分析,由于是共享免费服务器会对资源做一些限制以免影响他人使用,大家可以错峰使用(账号和存储都是独立的,不用担心别人看到你的数据);资源有限,大家分析完请及时清空和导出,以便让更多人使用。

也考虑到有些同学是初学者,我们也准备了linux和R语言基础课程及单细胞基础课,下面两门课中也有AI大模型讲解应用学习生信更高效,大家可以免费学习:

Linux入门课:https://bdtcd.xetslk.com/s/4dqHvY

R语言入门课:https://bdtcd.xetslk.com/s/4GwPsn

单细胞视频课程:https://bdtcd.xetslk.com/s/1NIpoo

提示

怎么领免费云服务器, 关注生信课堂公众号后台私信:单细胞云服务器+邮箱 ,(一定要输入完整邮箱避免收不到邮件)即可获取账号和登录方法:

图片领取方法

云服务器中免费代码:

单细胞转录组的代码放到免费的公共共享服务器中了我们会逐步把测试好的代码,放到公共文件夹下,让大家无障碍运行,打开就能看到, 既有模式物种小鼠,也有非模式物种玉米根的数据示例,方便大家分析数据。

图片单细胞分析示例代码运行效果图

生信课堂团队提供生信便捷式“云服务器”、“单细胞转录组数据分析服务”、“生信学习班”以及“生信交流群”等内容,有需要者可以扫描下方微信二维码咨询,并加讨论群领取学习资料:

图片欢迎扫描咨询

  • 发表于 1天前
  • 阅读 ( 24 )
  • 分类:转录组

你可能感兴趣的文章

相关问题

0 条评论

请先 登录 后评论
omicsgene
omicsgene

生物信息

798 篇文章

作家榜 »

  1. omicsgene 798 文章
  2. 安生水 372 文章
  3. Daitoue 167 文章
  4. 生物女学霸 120 文章
  5. xun 99 文章
  6. rzx 88 文章
  7. 红橙子 81 文章
  8. Ti Amo 78 文章