一种在药物发现中提取专利文献的工具
项目描述
PEMT:一种在药物发现中提取专利文献的工具
目录
基本信息
PEMT 是一种专利提取工具,使用户能够检索与药物发现相关的专利。该工具的整体工作流程如下图所示:
安装
$ pip install PEMT
最新的代码可以从GitHub 上的源代码安装:
$ pip install git+https://github.com/Fraunhofer-ITMP/PEMT.git
或者,对于开发人员,该工具可以以可编辑模式安装,如下所示:
$ git clone https://github.com/Fraunhofer-ITMP/PEMT.git
$ conda create --name pemt python=3.8
$ conda activate pemt
$ cd PEMT
$ pip install pemt
对于开发人员,可以从GitHub克隆存储库并以可编辑模式安装:
$ git clone https://github.com/Fraunhofer-ITMP/PEMT.git
$ cd PEMT
$ pip install -e .
文档
阅读官方文档了解更多信息。
输入数据格式
数据
要从基因级别运行 PEMT,您需要具有以下结构的输入文件:
| 象征 | uniprot |
|---|---|
| HGNC_Symbol_1 | Uniprot_ID_1 |
| HGNC_Symbol_2 | Uniprot_ID_2 |
| HGNC_Symbol_3 | Uniprot_ID_3 |
要从化学级别运行 PEMT,您需要具有以下结构的输入文件:
| 化学 |
|---|
| ChEMBL_ID_1 |
| ChEMBL_ID_2 |
| ChEMBL_ID_3 |
注意:数据必须采用逗号或制表符分隔的文件格式。如果不是这样,该文件应该至少有上面显示的列之一。
用法
为了使用 PEMT,需要安装chromedriver。
如上所述,该工具具有两步方法。这些步骤中的每一个都可以单独运行,也可以一起运行,如下所示:
- 化学富集
以下命令根据因果关系将化学物质与感兴趣的基因联系起来。
--uniprot在此命令中,有必要使用or--no-uniprot参数指示文件是否包含 uniprot id 。
$ pemt run-chemical-extractor --name=<ANALYSIS NAME> --data=<DATA FILE PATH> --input-type=<DATA FILE SEPARATOR> --uniprot
- 专利丰富 以下命令将化学品与公开可用的专利文献相互关联。
$ pemt run-patent-extractor --name=<ANALYSIS NAME> --chromedriver-path=<PATH TO CHROMEDRIVER> --os=<OS NAME> --no-chemical
如果用户有上述正确格式的化学品列表,我们还允许从这一步灵活地启动管道。然后用户必须使用标签--chemical并提供相应的--chemical-data路径。
- PEMT 工作流程 以下命令在基因数据上生成专利富集,其中基因数据文件是包含 uniprot 标识符的 TSV 文件。
$ pemt run-pemt --name=<ANALYSIS NAME> --data=<DATA FILE PATH> --input-type=<DATA FILE SEPARATOR> --chromedriver-path=<PATH TO CHROMEDRIVER> --os=<OS NAME>
问题
如果您在使用 PEMT 时遇到困难,请在我们的GitHub存储库中打开一个问题。
免责声明
PET 是一种以学术能力开发的科学工具,因此不提供维护、支持或数据备份的保证或保证。