Skip to main content

清理数据并返回清理后数据的实用程序

项目描述

PyPI - Python 版本 PyPI - 许可证 派皮 GitHub 存储库大小

数据清理

## 描述

在任何机器学习过程中,数据预处理是将原始/不干净数据转换为清洁数据的主要步骤,以便在后期应用机器学习算法。这个 python 包使数据预处理非常容易,只需 2 行代码。您只需输入原始数据(CSV 文件),该库将清理您的数据并返回清理后的数据框,您可以在其上进一步应用特征工程、特征选择和建模。

  • 这是做什么的?
    • 清除特殊字符
    • 删除重复项
    • 修复列名异常
    • 估算数据(分类和数字)

数据清洗

Data-cleaning 是一个用于数据预处理的 python 包。这将清理 CSV 文件并返回清理后的数据框。它执行插补、删除重复、替换特殊字符等工作。

如何使用:

第 1 步:安装 libaray

pip install data-cleaning

第2步:

导入库,并指定 csv 文件的路径。

from datacleaning import DataCleaning

dp = DataCleaning(file_uploaded='filename.csv')
cleaned_df = dp.start_cleaning()

您可以指定一些可选参数,如下所示,

用法:

from datacleaning import DataCleaning

DataCleaning(file_uploaded='filename.csv', separator=",", row_threshold=None, col_threshold=None,
         special_character=None, action=None, ignore_columns=None, imputation_type="RDF")

参数


范围 默认值 限制 例子
文件上传 没有任何 提供 CSV 文件。 文件名.csv
分隔器 , csv文件中使用的分隔符 ;
行阈值 没有任何 0 到 100 80
col_threshold 没有任何 0 到 100 80
特殊字符 检查下面的列表
指定default_list 中未列出的字符(见下文)
['$','?' ]
行动 没有任何 添加删除 添加
忽略列 没有任何 提供列名列表
以忽略特殊字符操作。
['column1','column2']
imputation_type RDF 选择您喜欢的插补
RDFKNNmeanmedianmost_frequentconstant
神经网络

使用参数的例子

- 将额外的特殊字符附加到现有的 default_list

包装中包含的默认特殊字符如下所示,

default_list = ["!", '"', "#", "%", "&", "'", "(", ")",
                  "*", "+", ",", "-", ".", "/", ":", ";", "<",
                  "=", ">", "?", "@", "[", "\\", "]", "^", "_",
                  "`", "{", "|", "}", "~", "–", "//", "%*", ":/", ".;", "Ø", "§",'$',"£"]

如何删除特殊字符,例如如果要删除“?” 和 ”%”。

注意:- 不要忘记给行动='删除'

from datacleaning import DataCleaning

dp = DataCleaning(file_uploaded='filename.csv', special_character =['?', '%'], action='remove')
cleaned_df = dp.start_cleaning()

如何添加特殊字符,例如,如果您想添加不在上面给出的 default_list 中的“é”。

注意:- 不要忘记给action = 'add'

from datacleaning import DataCleaning

dp = DataCleaning(file_uploaded='filename.csv', special_character =['é'], action='add')
cleaned_df = dp.start_cleaning()

- 忽略特定列并添加特殊字符

例如,需要删除名为“timestamp”和“date”的列,并需要添加一个特殊字符 'é'

from datacleaning import DataCleaning

dp = DataCleaning(file_uploaded='filename.csv', special_character =['é'],
              action='add', ignore_columns=['timestamp', 'date'])
cleaned_df = dp.start_cleaning()

- 更改阈值以删除高于此给定阈值的空行/列

from datacleaning import DataCleaning

dp = DataCleaning(file_uploaded='filename.csv', row_threshold=50, col_threshold=90)
cleaned_df = dp.start_cleaning()

- 可用的插补方法

  • RDF(随机森林)->(默认)
  • KNN(k-最近邻)
  • 意思是
  • 中位数
  • most_frequent
  • 持续的
# Example for KNN imputation.
from datacleaning import DataCleaning

dp = DataCleaning(file_uploaded='filename.csv', imputation_type='KNN')
cleaned_df = dp.start_cleaning()

>>谢谢你<<

下载文件

下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。

源分布

data-cleaning-1.0.1.tar.gz (6.7 kB 查看哈希)

已上传 source

内置分布

data_cleaning-1.0.1-py3-none-any.whl (6.3 kB 查看哈希)

已上传 py3