Skip to main content

用于数据预处理和特征工程的数据处理包。

项目描述

DataLiner - Python 的数据处理包

用于数据预处理和特征工程的数据处理包。
请随时发送拉取请求以进行错误修复、改进或新的预处理方法!

安装

! pip install dataliner

文档

https://shallowdf20.github.io/dataliner/preprocessing.html

快速开始

本例使用来自 Kaggle Titanic 的训练数据。https://www.kaggle.com/c/titanic/data

import pandas as pd
from sklearn.pipeline import make_pipeline
import dataliner as dl

df = pd.read_csv('train.csv')
target_col = 'Survived'
X = df.drop(target_col, axis=1)
y = df[target_col]

process = make_pipeline(
    dl.DropNoVariance(),
    dl.DropHighCardinality(),
    dl.BinarizeNaN(),
    dl.ImputeNaN(),
    dl.TargetMeanEncoding(),
    dl.DropHighCorrelation(),
    dl.StandardScaling(),
    dl.DropLowAUC(),
)

process.fit_transform(X, y)

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

内置分布

dataliner-1.3.1-py3-none-any.whl (46.1 kB 图哈希)

已上传 py3