Skip to main content

与 Pandas 数据帧一起使用的 Sklearn 转换器

项目描述

安装:

$ pip install pdtransform

一个带有几个转换器的小包,用于在 Sklearn 管道中处理 Pandas 数据帧,我发现自己经常编写它。示例用法:

from pdtransform import DFTransform, DFFeatureUnion

pipeline = Pipeline([
    ('ordinal_to_nums', DFTransform(_ordinal_to_nums, copy=True)),
    ('union', DFFeatureUnion([
        ('categorical', Pipeline([
            ('select', DFTransform(lambda X: X.select_dtypes(include=['object']))),
            ('fill_na', DFTransform(lambda X: X.fillna('NA'))),
            ('one_hot', DFTransform(_one_hot_encode)),
        ])),
        ('numerical', Pipeline([
            ('select', DFTransform(lambda X: X.select_dtypes(exclude=['object']))),
            ('fill_median', DFTransform(lambda X: X.fillna(X.median()))),
            ('add_features', DFTransform(_add_features, copy=True)),
            ('remove_skew', DFTransform(_remove_skew, copy=True)),
            ('find_outliers', DFTransform(_find_outliers, copy=True)),
            ('normalize', DFTransform(lambda X: X.div(X.max())))
        ])),
    ])),
])

有关更多信息,请阅读此博客文章

项目详情


下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

pdtransform-0.2.tar.gz (2.2 kB 查看哈希

已上传 source

内置分布

pdtransform-0.2-py2.py3-none-any.whl (3.8 kB 查看哈希

已上传 3 6