Skip to main content

西班牙语 twitter 的 BERT 实现。

项目描述

比尔玛

伯特在拉丁美洲

Bilma 是 tensorflow 中的 BERT 实现,并在https://sadit.github.io/regional-spanish-models-talk-2022/数据集下的 Masked Language Model 任务上进行了训练。

区域模型可以从http://geo.ingeotec.mx/~lgruiz/regional-models-bilma/下载。您还需要下载所有模型和地区通用的词汇文件。

针对不同区域的 MLM 任务训练的模型的准确度为:

bilma-mlm-comp

我们还微调了表情预测的模型,得到的准确度如下:

bilma-cls-comp

先决条件

您将需要 TensorFlow 2.4 或更高版本。

快速指南

您可以查看演示笔记本以获取有关如何使用模型的快速指南。

克隆此存储库,然后运行

bash download-emoji15-bilma.sh

下载 MX 模型。然后加载模型,您可以使用以下代码:

from bilma import bilma_model
vocab_file = "vocab_file_All.txt"
model_file = "bilma_small_MX_epoch-1_classification_epochs-13.h5"
model = bilma_model.load(model_file)
tokenizer = bilma_model.tokenizer(vocab_file=vocab_file,
max_length=280)

现在你需要一些文本:

texts = ["Tenemos tres dias sin internet ni senal de celular en el pueblo.",
         "Incomunicados en el siglo XXI tampoco hay servicio de telefonia fija",
         "Vamos a comer unos tacos",
         "Los del banco no dejan de llamarme"]
toks = tokenizer.tokenize(texts)

有了这个,你就可以使用模型了

p = model.predict(toks)
tokenizer.decode_emo(p[1])

产生输出:表情符号输出 每个表情符号对应于texts.

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

bilma-0.1.11.tar.gz (112.4 kB 查看哈希)

已上传 source

内置分布

bilma-0.1.11-py3-none-any.whl (110.7 kB 查看哈希)

已上传 py3