Skip to main content

CRISPR-Cas 操纵子的自动检测和分型

项目描述

CasPredict

检测 CRISPR-Cas 基因和阵列,并根据 Cas 基因和 CRISPR 重复序列预测亚型。

CasPredict 和 RepeatType 也可以通过网络服务器获得

该软件找到具有大量 HMM 的 Cas 基因,然后将这些 HMM 分组为操纵子,并根据评分方案预测操纵子的亚型。此外,它找到了带有 minced 的 CRISPR 阵列并使用基于 kmer 的机器学习方法(极端梯度提升树)根据一致重复预测 CRISPR 阵列的子类型。然后它连接 Cas 操作子和 CRISPR 阵列,产生如下输出:

  • CRISPR-Cas 基因座,具有基于 Cas 基因(大部分)和 CRISPR 共有重复序列的共有亚型预测
  • 孤儿 Cas 操纵子及其预测的亚型
  • 孤儿 CRISPR 阵列及其预测的相关亚型

它包括以下子类型:

它可以自动绘制CRISPR-Cas系统和孤儿Cas操纵子和CRISPR阵列的基因图谱

引文

快来了...

目录

  1. 快速开始
  2. 安装
  3. CasPredict - 如何
  4. 重复类型 - 如何
  5. 重复类型 - 训练

快速开始

conda create -n caspredict -c conda-forge -c bioconda -c russel88 caspredict
conda activate caspredict
caspredict my.fasta my_output

安装

CasPredict 可以通过 conda 或 pip 安装。

建议使用 conda,因为它会安装 CasPredict 和所有依赖项,并一次性下载数据库。

康达

使用minicondaanaconda安装。

使用 caspredict 和所有依赖项和数据库创建环境

conda create -n caspredict -c conda-forge -c bioconda -c russel88 caspredict

点子

如果您的 PATH 中有依赖项(Python >= 3.8、HMMER >= 3.2、Prodigal >= 2.6、grep、sed),您可以使用 pip 安装

python -m pip install caspredict

使用 pip 安装时,需要手动下载数据库:

# Download and unpack
svn checkout https://github.com/Russel88/CasPredict/trunk/data
tar -xvzf data/Profiles.tar.gz
mv Profiles/ data/
rm data/Profiles.tar.gz

# Tell CasPredict where the data is:
# either by setting an environment variable (has to done for each terminal session, or added to .bashrc):
export CASPREDICT_DB="/path/to/data/"
# or by using the --db argument each time you run CasPredict:
caspredict input.fa output --db /path/to/data/

CasPredict - 如何

CasPredict 将核苷酸 fasta 作为输入,并使用 CRISPR-Cas 预测生成输出

激活环境

conda activate caspredict

以核苷酸 fasta 作为输入运行

caspredict genome.fa my_output

使用多个线程

caspredict genome.fa my_output -t 20

检查不同的选项

caspredict -h

输出

  • CRISPR_Cas.tab:CRISPR_Cas 基因座,具有共识亚型预测

    • 包含一致预测 (Prediction),以及 Cas 操纵子 (Prediction_Cas) 和 CRISPR 阵列 (Prediction_CRISPRs) 的单独预测
  • cas_operons.tab: 所有特定的 Cas操作子

    • 包含子类型的预测(Prediction)和得分最高的子类型(Best_type)。如果分数很高,那么 Prediction = Best_type
  • crisprs_all.tab: 所有 CRISPR 阵列

    • 包含基于重复序列的关联子类型的预测(预测)。
    • “子类型”列是概率最高的子类型。如果 Subtype_probability 很高,则预测 = 子类型
  • crisprs_orphan.tab: 孤儿 CRISPR(不在 CRISPR_Cas.tab 中的)

    • 与 crisprs_all.tab 相同的列
  • cas_operons_orphan.tab: 孤儿 Cas 操作子(不在 CRISPR_Cas.tab 中的)

    • 与 cas_operons.tab 相同的列
  • CRISPR_Cas_putative.tab: 推定的 CRISPR_Cas 基因座,通常是 CRISPR 阵列旁边的孤独 Cas 基因

    • 与 CRISPR_Cas.tab 相同的列
  • cas_operons_putative.tab:推定的Cas操作子,多为误报,但也有一些模棱两可和部分系统

    • 与 cas_operons.tab 相同的列
  • spacers/*.fa: 包含所有间隔序列的 Fasta 文件

  • hmmer.tab: 所有 HMM 与 ORF 匹配,未过滤的结果

  • genes.tab 所有基因及其位置

  • arguments.tab: 带有给 CasPredict 的参数的文件

  • hmmer.log 来自 HMMER 的错误消息(仅在遇到任何错误时生成)

如果运行--keep_tmp以下内容也会产生
  • prodigal.log 来自 prodigal 的日志
  • 蛋白质 .faa 蛋白质序列
  • hmmer/*.tab 每个 Cas HMM 的 HMMER 对齐输出
  • minced.out: 来自 minced 的 CRISPR 数组输出

输出说明

仅当有任何数据时才会创建文件。例如,只有存在任何 CRISPR-Cas 基因座时才会创建 CRISPR_Cas.tab 文件。

绘图

CasPredict 将自动绘制 CRISPR-Cas 基因座、孤儿 Cas 操纵子和孤儿 CRISPR 阵列的图谱。

这些图谱可以--expand N通过添加未知基因和比对分数低于阈值的基因来扩展( )。这可以帮助识别操纵子中潜在的未注释基因。--redo_typing您可以通过添加命令来生成新图,而无需重新运行整个管道。这将根据新的阈值和绘图参数重新使用映射并重新键入操作子并重新绘制绘图。

下面的情节是用--expand 5

  • Cas基因为红色。
  • 比对分数低于阈值的 Cas 基因呈深绿色
  • 未知基因为灰色(数字与genes.tab 文件匹配)
  • 阵列为蓝色,其预测的亚型关联基于共有重复序列。

重复类型 - 如何

输入 CRISPR 重复(每行一个,在一个简单的文本文件中)RepeatType 将根据重复的 kmer 组成预测子类型

激活环境

conda activate caspredict

使用一个简单的文本文件运行,仅包含 CRISPR 重复(大写字母),每行一个重复。

repeatType repeats.txt

输出

脚本打印:

  • 重复序列
  • 预测亚型
  • 预测概率

输出说明

  • 概率低于 0.75 的预测是不确定的,应该持保留态度。
  • 分类器仅在有足够(> 20)重复的亚型上进行训练。因此,它只能预测与以下亚型相关的重复亚型:
    • IA、IB、IC、ID、IE、IF、IG
    • II-A、II-B、II-C
    • III-A、III-B、III-C、III-D
    • IV-A1、IV-A2、IV-A3
    • 弗吉尼亚州
    • Ⅵ-B
  • 这是每个子类型的准确度(在看不见的测试数据集上):
    • IA 0.60
    • IB 0.90
    • 集成电路 0.98
    • 标识 0.47
    • IE 1.00
    • 中频 0.99
    • 0.83 _
    • II-A 0.94
    • II-B 1.00
    • II-C 0.89
    • III-A 0.89
    • III-B 0.49
    • III-C 0.60
    • III-D 0.28
    • IV-A1 0.79
    • IV-A2 0.78
    • IV-A3 0.98
    • 弗吉尼亚州 0.77
    • VI-B 1.00

重复类型 - 训练

您可以使用自己的子类型重复集来训练重复分类器。使用制表符分隔的输入,其中 1. 列包含子类型,2. 列包含 CRISPR 重复序列,RepeatTrain 将训练可直接用于 RepeatType 和 CasPredict 的 CRISPR 重复分类器。

火车

repeatTrain typed_repeats.tab my_classifier

在 RepeatType 中使用新模型

repeatType repeats.txt --db my_classifier

在 CasPredict 中使用新模型

保存原始数据库文件:

mv ${CASPREDICT_DB}/type_dict.tab ${CASPREDICT_DB}/type_dict_orig.tab
mv ${CASPREDICT_DB}/xgb_repeats.model ${CASPREDICT_DB}/xgb_repeats_orig.model

将新模型移动到数据库文件夹中

mv my_classifier/* ${CASPREDICT_DB}/
CasPredict 和 RepeatType 现在将使用新模型进行重复预测!

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

caspredict-0.5.4.tar.gz (25.0 kB 查看哈希

已上传 source

内置分布

caspredict-0.5.4-py3.8.egg (53.5 kB 查看哈希

已上传 3 8