西班牙语 twitter 的 BERT 实现。
项目描述
比尔玛
伯特在拉丁美洲
Bilma 是 tensorflow 中的 BERT 实现,并在https://sadit.github.io/regional-spanish-models-talk-2022/数据集下的 Masked Language Model 任务上进行了训练。
区域模型可以从http://geo.ingeotec.mx/~lgruiz/regional-models-bilma/下载。您还需要下载所有模型和地区通用的词汇文件。
针对不同区域的 MLM 任务训练的模型的准确度为:
我们还微调了表情预测的模型,得到的准确度如下:
先决条件
您将需要 TensorFlow 2.4 或更高版本。
快速指南
您可以查看演示笔记本以获取有关如何使用模型的快速指南。
克隆此存储库,然后运行
bash download-emoji15-bilma.sh
下载 MX 模型。然后加载模型,您可以使用以下代码:
from bilma import bilma_model
vocab_file = "vocab_file_All.txt"
model_file = "bilma_small_MX_epoch-1_classification_epochs-13.h5"
model = bilma_model.load(model_file)
tokenizer = bilma_model.tokenizer(vocab_file=vocab_file,
max_length=280)
现在你需要一些文本:
texts = ["Tenemos tres dias sin internet ni senal de celular en el pueblo.",
"Incomunicados en el siglo XXI tampoco hay servicio de telefonia fija",
"Vamos a comer unos tacos",
"Los del banco no dejan de llamarme"]
toks = tokenizer.tokenize(texts)
有了这个,你就可以使用模型了
p = model.predict(toks)
tokenizer.decode_emo(p[1])
产生输出:
每个表情符号对应于
texts.
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
bilma-0.1.11.tar.gz
(112.4 kB
查看哈希)
内置分布
bilma-0.1.11-py3-none-any.whl
(110.7 kB
查看哈希)