用于数据预处理和特征工程的数据处理包。
项目描述
DataLiner - Python 的数据处理包
用于数据预处理和特征工程的数据处理包。
请随时发送拉取请求以进行错误修复、改进或新的预处理方法!
安装
! pip install dataliner
文档
https://shallowdf20.github.io/dataliner/preprocessing.html
快速开始
本例使用来自 Kaggle Titanic 的训练数据。https://www.kaggle.com/c/titanic/data
import pandas as pd
from sklearn.pipeline import make_pipeline
import dataliner as dl
df = pd.read_csv('train.csv')
target_col = 'Survived'
X = df.drop(target_col, axis=1)
y = df[target_col]
process = make_pipeline(
dl.DropNoVariance(),
dl.DropHighCardinality(),
dl.BinarizeNaN(),
dl.ImputeNaN(),
dl.TargetMeanEncoding(),
dl.DropHighCorrelation(),
dl.StandardScaling(),
dl.DropLowAUC(),
)
process.fit_transform(X, y)