从 scRNA-seq 原始数据中识别病原微生物的管道
项目描述
病原体追踪
PathogenTrack 是一种无监督计算软件,用于在单细胞水平上unmapped single-cell RNAseq reads进行表征。intracellular pathogens它是一个基于 python 的脚本,可用于识别和量化细胞内致病性viruses并bacteria在单细胞水平上读取。PathogenTrack 已经在源自模拟和真实数据集的各种 scRNA-seq 数据集上进行了测试,并且表现稳健。细节在我们的论文中有所描述Decoding Intracellular Pathogens of scRNA-seq experiments with PathogenTrack and SCKIT。
系统要求
PathogenTrack 已经在具有 CentOS 7 操作系统的 Linux 平台上进行了测试。RAM 为 120 GB,具有 40 个计算线程。
安装
PathogenTrack 可以分两步安装:
1. 在 Linux 平台上安装 Miniconda。详情请参考Miniconda 安装。
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh
2. 安装 PathogenTrack。
conda env create -f environment.yml
用户可以手动安装依赖项。下面列出了依赖项和测试版本。
| 包裹 | 版本 |
|---|---|
| Python | 3.6.10 |
| 生物蟒 | 1.78 |
| 星星 | 2.7.5a |
| umi_tools | 1.1.1 |
| 海妖2 | 2.1.1 |
数据库准备
1. 准备人类基因组数据库
下载 Human GRCh38 基因组和基因组注释文件,然后解压缩:
wget ftp://ftp.ensembl.org/pub/release-101/fasta/homo_sapiens/dna/Homo_sapiens.GRCh38.dna.toplevel.fa.gz
gzip -d Homo_sapiens.GRCh38.dna.toplevel.fa.gz
wget ftp://ftp.ensembl.org/pub/release-101/gtf/homo_sapiens/Homo_sapiens.GRCh38.101.gtf.gz
gzip -d Homo_sapiens.GRCh38.101.gtf.gz
使用以下命令构建 STAR 索引:
STAR --runThreadN 16 --runMode genomeGenerate --genomeDir ./ \
--genomeFastaFiles ./Homo_sapiens.GRCh38.dna.toplevel.fa \
--sjdbGTFfile ./Homo_sapiens.GRCh38.101.gtf \
--sjdbOverhang 100
2.准备Kraken2数据库
wget ftp://ftp.ccb.jhu.edu/pub/data/kraken2_dbs/minikraken_8GB_202003.tgz
tar zxf minikraken_8GB_202003.tgz
如何使用 PathogenTrack?
在运行本教程之前,您应该运行cellranger或alevin获取单细胞的基因表达矩阵。这里,我们以模拟的 10X 测序数据为例:
首先,我们使用 cellranger 获取 scRNA-seq 表达矩阵和有效条形码:
cellranger count --id cellranger_out --transcriptom /path/to/cellranger_database/
然后我们运行 PathogenTrack 来识别和量化单细胞水平的病原体表达:
conda activate PathogenTrack
python PathogenTrack.py count --project_id PathogenTrack_out --pattern CCCCCCCCCCCCCCCCNNNNNNNNNN \
--min_reads 10 --confidence 0.11 --star_index ~/database/STAR_index/ \
--kraken_db ~/database/minikraken_8GB_20200312/ --barcode barcodes.tsv \
--read1 simulation_S1_L001_R1_001.fastq.gz \
--read2 simulation_S1_L001_R2_001.fastq.gz
重要提示:示例中的读取 1 由 16 bp CB 和 10 bp UMI 组成,因此 --pattern 为 CCCCCCCCCCCCCCCNNNNNNNNNN ( 16C 和 10N)。用户必须使用自己的 Read 1 相应地调整模式。
注意:完成一个样本可能需要 4-6 小时,这取决于计算资源的性能和原始单细胞数据的大小。
请参阅QUICK_START.md以获得完整的教程。
问题
关于管道或代码的问题和建议,请联系admin@ncrna.net和ty12260@rjh.com.cn。我们将尽最大努力提供支持、解决新问题并不断改进此软件。
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
内置分布
PathogenTrack-0.2.3- py3 -none-any.whl 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | 2953cd6ae04266f75768c5e91cd3db76c1ad176634e44a073a2c4e92a5b8e792 |
|
| MD5 | 0aed80af770bedaf98f51ed5f6175ea7 |
|
| 布莱克2-256 | 7cbc0d957d20ec847f8309b71002837e5f33698c0ecfd7696afe127c8595f05d |