Skip to main content

表征 SJ.out.tab 文件输出的拼接点

项目描述

splicejunxchx

Splicejunxchx 是一个 Python 管道,它采用 STAR (SJ.out.tab) 输出的拼接点和一个 GTF 文件来表征拼接点的 5' 和 3' 拼接位点。

该管道包括以下功能:

  • 确定 5'/3' 末端是否在基因、转录本、外显子、内含子、5'UTR、CDS、3'UTR、起始密码子或终止密码子中
  • 确定 5'/3' 剪接位点 (ss) 是否位于组成型外显子或内含子中
  • 根据GTF文件中的信息判断5'/3'端是否标注
  • 从分析的连接点的 5' 和 3' ss 查找最近的 ss 上游和下游

具有所需依赖项的附加功能:

  • 以每个拼接位点为中心的 51 个碱基(需要床具)
  • 5'/3' ss(床具)的 2 个底座
  • maxEnt 分数(需要下载 maxEnt perl 文件)
  • 每个剪接位点周围平均 N 个核苷酸的 phyloP 评分(bigWigtoBedGraph)

安装

首先,你必须有 python3.6>=、pandas0.23.4>= 和 gtf2csv(见下文)

pip install git+https://github.com/zyxue/gtf2csv.git#egg=gtf2csv

查看以下网站获取:bedtools、bigWigToBedGraph 和 maxEnt sccores:

  • 床具
  • bigWigToBedGraph
  • 对于maxEnt,确保下载 fordownload.tar.gz 并将 score5.pl、score3.pl、me2x5 和目录 splicemodels 放在您计划运行 splicejunxchx 的根目录中

现在,使用以下命令安装 splicejunxchx:

pip install splicejunxchx

用法

一个建议是确保在您计划使用此代码的任何根目录中都有一个“数据”目录。数据目录将存储一些临时文件,包括: 两个基于 GTF 文件的所有剪接点和组成外显子的 CSV 文件

以下是 splicejunxchx 可以添加的全部使用可能性

splicejunxchx -h [-seqs SEQUENCE_FILE] [-supp SUPPORT_FILES SUPPORT_FILES] [-phyloP PHYLOPSCORES PHYLOPSCORES] [-maxEnt] inputs inputs output_file

有几种方法可以利用此管道。首先,基本的方法是输入gtf.gz文件和SJ.out.tab文件并命名输出文件。这将输出带有基本信息的剪接点,这些信息包括根据 GTF 的每个剪接位点所在的位置以及其他最近的剪接位点所在的位置。要运行此命令:

splicejunxchx raw_data/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv

如果您有兴趣添加序列信息,则必须安装bedtools(带有getfasta功能),然后在-seq之后添加.fa文件:

splicejunxchx raw_data/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv -seq data/Homo_sapiens.GRCh38.95.fa 

在某些情况下,为了提高速度和时间,可以将报告的剪接点和组成外显子的支持文件提供给 splicejunxchx(如果有)。

  • 报告的接头文件必须是 csv,包含以下列:[seqname,start,end,strand]
  • 报告的剪接点文件必须是具有以下列的 csv:[seqname,start,end,strand,exon_id,gene_id]
  • 如果您想使用相同的 GTF 文件但在第二次运行时具有不同的拼接点,则管道会在第一次运行时生成上述文件
splicejunxchx raw_data/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv -supp data/all_splice_junctions.csv data/cons_exons.csv

如果您想包含 maxEnt 分数,请包括 score5.pl、score3.pl、me2x5 以及您计划运行 splicejunxchx 的根目录中的 splicemodels。还要添加 -maxEnt 标志

最后,要合并 phyloP 分数,此标签的输入需要 phyloPscore 文件作为 bigWig (.bw),第二个输入是每个剪接位点周围请求的单个 phyloP 分数的核苷酸数。此数字不能超过 200,并且必须是偶数。

splicejunxchx raw/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv -phyloP data/hg38.phyloP.bw 20

笔记

关于所需文件和输出结构的一般说明

确保提供的 GTF 文件未列出内含子位置。此管道假定 GTF 文件中存在的唯一特征是:基因、转录本、外显子、five_prime_utr、CDS、three_prime_utr、起始密码子、终止密码子和硒代半胱氨酸

对于具有未知链 (strand = 0) 的拼接点,管道创建该拼接点的两个副本,并将一个连接点的 strand=1 更改为 strand=2

  • EX:如果 JNC92 的链为 0
    • 管道创建两个结点,称为 JNC92.1 (strand =1) 和 JNC92.2 (strand=2)
  • 要查找 strand=0 的拼接点,请搜索将“unidentified_strand”列设置为值 1 的接头

输出文件中的列

以下列提供了更多详细信息:

  • 主题:[0:非规范;1:GT/AG,2:CT/AC,3:GC/AG,4:CT/GC,5:AT/AC,6:GT/AT]
  • STAR_annotation:根据 STAR 将 5' 和 3' 剪接位点注释为一个剪接点
  • Unidentified_strand:拼接点最初是未定义的(Strand = 0),但这个连接点是在假设处于正链或负链上的情况下开发的(参见“链”列进行假设)
  • 5'_in_constitutiveexon:基因名称后跟坐标,否则不适用
  • 5'_in_constitutiveintron:基因名称后跟坐标,否则不适用
  • 5'_in_CDS:如果5'端在编码序列区域
  • 5'phyloPscore:每个剪接位点 N 个核苷酸的平均得分
  • 5'phylopList:从最低坐标到最高坐标的phyloP值列表
  • 5'bases_maxEnt 和 3'bases_maxEnt:运行一个 maxEnt 分数所需的序列
  • 类似的逻辑存在于 3' 区域

致谢

  • Athma Pai 和 Eraj Khokhar 提供指导和支持
  • Zyxue for gtf2csv:https ://github.com/zyxue/gtf2csv
  • Yeo G 和 Burge CB,短序列基序的最大熵建模与 RNA 剪接信号的应用,RECOMB 2003(Journal Comp. Bio in press)

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

splicejunxchx-2.8.tar.gz (30.2 kB 查看哈希

已上传 source

内置发行版

splicejunxchx-2.8-py3.8.egg (32.6 kB 查看哈希

已上传 3 8

splicejunxchx-2.8-py3-none-any.whl (18.5 kB 查看哈希

已上传 py3