表征 SJ.out.tab 文件输出的拼接点
项目描述
splicejunxchx
Splicejunxchx 是一个 Python 管道,它采用 STAR (SJ.out.tab) 输出的拼接点和一个 GTF 文件来表征拼接点的 5' 和 3' 拼接位点。
该管道包括以下功能:
- 确定 5'/3' 末端是否在基因、转录本、外显子、内含子、5'UTR、CDS、3'UTR、起始密码子或终止密码子中
- 确定 5'/3' 剪接位点 (ss) 是否位于组成型外显子或内含子中
- 根据GTF文件中的信息判断5'/3'端是否标注
- 从分析的连接点的 5' 和 3' ss 查找最近的 ss 上游和下游
具有所需依赖项的附加功能:
- 以每个拼接位点为中心的 51 个碱基(需要床具)
- 5'/3' ss(床具)的 2 个底座
- maxEnt 分数(需要下载 maxEnt perl 文件)
- 每个剪接位点周围平均 N 个核苷酸的 phyloP 评分(bigWigtoBedGraph)
安装
首先,你必须有 python3.6>=、pandas0.23.4>= 和 gtf2csv(见下文)
pip install git+https://github.com/zyxue/gtf2csv.git#egg=gtf2csv
查看以下网站获取:bedtools、bigWigToBedGraph 和 maxEnt sccores:
- 床具
- bigWigToBedGraph
- 对于maxEnt,确保下载 fordownload.tar.gz 并将 score5.pl、score3.pl、me2x5 和目录 splicemodels 放在您计划运行 splicejunxchx 的根目录中
现在,使用以下命令安装 splicejunxchx:
pip install splicejunxchx
用法
一个建议是确保在您计划使用此代码的任何根目录中都有一个“数据”目录。数据目录将存储一些临时文件,包括: 两个基于 GTF 文件的所有剪接点和组成外显子的 CSV 文件
以下是 splicejunxchx 可以添加的全部使用可能性
splicejunxchx -h [-seqs SEQUENCE_FILE] [-supp SUPPORT_FILES SUPPORT_FILES] [-phyloP PHYLOPSCORES PHYLOPSCORES] [-maxEnt] inputs inputs output_file
有几种方法可以利用此管道。首先,基本的方法是输入gtf.gz文件和SJ.out.tab文件并命名输出文件。这将输出带有基本信息的剪接点,这些信息包括根据 GTF 的每个剪接位点所在的位置以及其他最近的剪接位点所在的位置。要运行此命令:
splicejunxchx raw_data/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv
如果您有兴趣添加序列信息,则必须安装bedtools(带有getfasta功能),然后在-seq之后添加.fa文件:
splicejunxchx raw_data/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv -seq data/Homo_sapiens.GRCh38.95.fa
在某些情况下,为了提高速度和时间,可以将报告的剪接点和组成外显子的支持文件提供给 splicejunxchx(如果有)。
- 报告的接头文件必须是 csv,包含以下列:[seqname,start,end,strand]
- 报告的剪接点文件必须是具有以下列的 csv:[seqname,start,end,strand,exon_id,gene_id]
- 如果您想使用相同的 GTF 文件但在第二次运行时具有不同的拼接点,则管道会在第一次运行时生成上述文件
splicejunxchx raw_data/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv -supp data/all_splice_junctions.csv data/cons_exons.csv
如果您想包含 maxEnt 分数,请包括 score5.pl、score3.pl、me2x5 以及您计划运行 splicejunxchx 的根目录中的 splicemodels。还要添加 -maxEnt 标志
最后,要合并 phyloP 分数,此标签的输入需要 phyloPscore 文件作为 bigWig (.bw),第二个输入是每个剪接位点周围请求的单个 phyloP 分数的核苷酸数。此数字不能超过 200,并且必须是偶数。
splicejunxchx raw/Homo_sapiens.GRCh38.95.gtf.gz raw_data/ERR152SJ.out.tab output/final_splice_junc.csv -phyloP data/hg38.phyloP.bw 20
笔记
关于所需文件和输出结构的一般说明
确保提供的 GTF 文件未列出内含子位置。此管道假定 GTF 文件中存在的唯一特征是:基因、转录本、外显子、five_prime_utr、CDS、three_prime_utr、起始密码子、终止密码子和硒代半胱氨酸
对于具有未知链 (strand = 0) 的拼接点,管道创建该拼接点的两个副本,并将一个连接点的 strand=1 更改为 strand=2
- EX:如果 JNC92 的链为 0
- 管道创建两个结点,称为 JNC92.1 (strand =1) 和 JNC92.2 (strand=2)
- 要查找 strand=0 的拼接点,请搜索将“unidentified_strand”列设置为值 1 的接头
输出文件中的列
以下列提供了更多详细信息:
- 主题:[0:非规范;1:GT/AG,2:CT/AC,3:GC/AG,4:CT/GC,5:AT/AC,6:GT/AT]
- STAR_annotation:根据 STAR 将 5' 和 3' 剪接位点注释为一个剪接点
- Unidentified_strand:拼接点最初是未定义的(Strand = 0),但这个连接点是在假设处于正链或负链上的情况下开发的(参见“链”列进行假设)
- 5'_in_constitutiveexon:基因名称后跟坐标,否则不适用
- 5'_in_constitutiveintron:基因名称后跟坐标,否则不适用
- 5'_in_CDS:如果5'端在编码序列区域
- 5'phyloPscore:每个剪接位点 N 个核苷酸的平均得分
- 5'phylopList:从最低坐标到最高坐标的phyloP值列表
- 5'bases_maxEnt 和 3'bases_maxEnt:运行一个 maxEnt 分数所需的序列
- 类似的逻辑存在于 3' 区域
致谢
- Athma Pai 和 Eraj Khokhar 提供指导和支持
- Zyxue for gtf2csv:https ://github.com/zyxue/gtf2csv
- Yeo G 和 Burge CB,短序列基序的最大熵建模与 RNA 剪接信号的应用,RECOMB 2003(Journal Comp. Bio in press)
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
内置发行版
splicejunxchx -2.8.tar.gz 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | 33749fbe065785143fa568aa6d1b49024973161ed367d0341964b453abab0f19 |
|
| MD5 | 40f90d27a16bbf30326cda1dcd363d0e |
|
| 布莱克2-256 | 377a288af759a73c8968d4e213220722ee32c1155ed14813b9f5b16195b2579f |
splicejunxchx -2.8-py3.8.egg 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | 4eab8284eb2c16c4f7eacae965bd0940eed1a4e29eeb66d13aaad6647b2b5d4a |
|
| MD5 | 3aed1549c3eaebce963c140ac3c63a76 |
|
| 布莱克2-256 | 07c583ebd81a3b16d23cf39d8eb2be98e531b56e77f0ad574059ed2dd161a1f3 |
splicejunxchx -2.8-py3-none-any.whl 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | c2900d22df321462e746274703850e32a621045c37b947cdc5e6590c97e93881 |
|
| MD5 | b692f4ac8526b74452e87bab37a74dc3 |
|
| 布莱克2-256 | 0d3e6b49da9a89984860fc75e1e842b55a8ce106147f2681d8132a25851898b3 |