Skip to main content

从 scRNA-seq 原始数据中识别病原微生物的管道

项目描述

构建状态 皮皮 麻省理工学院许可证

病原体追踪

PathogenTrack 是一种无监督计算软件,用于在单细胞水平上unmapped single-cell RNAseq reads进行表征。intracellular pathogens它是一个基于 python 的脚本,可用于识别和量化细胞内致病性viruses并bacteria在单细胞水平上读取。PathogenTrack 已经在源自模拟和真实数据集的各种 scRNA-seq 数据集上进行了测试,并且表现稳健。细节在我们的论文中有所描述Decoding Intracellular Pathogens of scRNA-seq experiments with PathogenTrack and SCKIT。

系统要求

PathogenTrack 已经在具有 CentOS 7 操作系统的 Linux 平台上进行了测试。RAM 为 120 GB,具有 40 个计算线程。

安装

PathogenTrack 可以分两步安装:

1. 在 Linux 平台上安装 Miniconda。详情请参考Miniconda 安装。

wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh

2. 安装 PathogenTrack。

conda env create -f environment.yml

用户可以手动安装依赖项。下面列出了依赖项和测试版本。

包裹 版本
Python 3.6.10
生物蟒 1.78
星星 2.7.5a
umi_tools 1.1.1
海妖2 2.1.1

数据库准备

1. 准备人类基因组数据库

下载 Human GRCh38 基因组和基因组注释文件,然后解压缩:

wget ftp://ftp.ensembl.org/pub/release-101/fasta/homo_sapiens/dna/Homo_sapiens.GRCh38.dna.toplevel.fa.gz
gzip -d Homo_sapiens.GRCh38.dna.toplevel.fa.gz
wget ftp://ftp.ensembl.org/pub/release-101/gtf/homo_sapiens/Homo_sapiens.GRCh38.101.gtf.gz
gzip -d Homo_sapiens.GRCh38.101.gtf.gz

使用以下命令构建 STAR 索引:

STAR --runThreadN 16 --runMode genomeGenerate --genomeDir ./ \
     --genomeFastaFiles ./Homo_sapiens.GRCh38.dna.toplevel.fa \
     --sjdbGTFfile ./Homo_sapiens.GRCh38.101.gtf \
     --sjdbOverhang 100

2.准备Kraken2数据库

wget ftp://ftp.ccb.jhu.edu/pub/data/kraken2_dbs/minikraken_8GB_202003.tgz
tar zxf minikraken_8GB_202003.tgz

如何使用 PathogenTrack?

在运行本教程之前,您应该运行cellranger或alevin获取单细胞的基因表达矩阵。这里,我们以模拟的 10X 测序数据为例:

首先,我们使用 cellranger 获取 scRNA-seq 表达矩阵和有效条形码:

cellranger count --id cellranger_out --transcriptom /path/to/cellranger_database/

然后我们运行 PathogenTrack 来识别和量化单细胞水平的病原体表达:

conda activate PathogenTrack
python PathogenTrack.py count --project_id PathogenTrack_out --pattern CCCCCCCCCCCCCCCCNNNNNNNNNN \
                              --min_reads 10 --confidence 0.11 --star_index ~/database/STAR_index/ \
                              --kraken_db ~/database/minikraken_8GB_20200312/ --barcode barcodes.tsv \
                              --read1 simulation_S1_L001_R1_001.fastq.gz \
                              --read2 simulation_S1_L001_R2_001.fastq.gz 

重要提示:示例中的读取 1 由 16 bp CB 和 10 bp UMI 组成,因此 --pattern 为 CCCCCCCCCCCCCCCNNNNNNNNNN ( 16C 和 10N)。用户必须使用自己的 Read 1 相应地调整模式。

注意:完成一个样本可能需要 4-6 小时,这取决于计算资源的性能和原始单细胞数据的大小。

请参阅QUICK_START.md以获得完整的教程。

问题

关于管道或代码的问题和建议,请联系admin@ncrna.net和ty12260@rjh.com.cn。我们将尽最大努力提供支持、解决新问题并不断改进此软件。

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

PathogenTrack-0.2.3.tar.gz (11.2 kB 查看哈希)

已上传 source

内置分布

PathogenTrack-0.2.3-py3-none-any.whl (9.3 kB 查看哈希)

已上传 py3