清理数据并返回清理后数据的实用程序
项目描述
数据清理
## 描述在任何机器学习过程中,数据预处理是将原始/不干净数据转换为清洁数据的主要步骤,以便在后期应用机器学习算法。这个 python 包使数据预处理非常容易,只需 2 行代码。您只需输入原始数据(CSV 文件),该库将清理您的数据并返回清理后的数据框,您可以在其上进一步应用特征工程、特征选择和建模。
- 这是做什么的?
- 清除特殊字符
- 删除重复项
- 修复列名异常
- 估算数据(分类和数字)
数据清洗
Data-cleaning 是一个用于数据预处理的 python 包。这将清理 CSV 文件并返回清理后的数据框。它执行插补、删除重复、替换特殊字符等工作。
如何使用:
第 1 步:安装 libaray
pip install data-cleaning
第2步:
导入库,并指定 csv 文件的路径。
from datacleaning import DataCleaning
dp = DataCleaning(file_uploaded='filename.csv')
cleaned_df = dp.start_cleaning()
您可以指定一些可选参数,如下所示,
用法:
from datacleaning import DataCleaning
DataCleaning(file_uploaded='filename.csv', separator=",", row_threshold=None, col_threshold=None,
special_character=None, action=None, ignore_columns=None, imputation_type="RDF")
参数
| 范围 | 默认值 | 限制 | 例子 |
|---|---|---|---|
| 文件上传 | 没有任何 | 提供 CSV 文件。 | 文件名.csv |
| 分隔器 | , | csv文件中使用的分隔符 | ; |
| 行阈值 | 没有任何 | 0 到 100 | 80 |
| col_threshold | 没有任何 | 0 到 100 | 80 |
| 特殊字符 | 检查下面的列表 | 指定default_list 中未列出的字符(见下文) |
['$','?' ] |
| 行动 | 没有任何 | 添加或删除 | 添加 |
| 忽略列 | 没有任何 | 提供列名列表 以忽略特殊字符操作。 |
['column1','column2'] |
| imputation_type | RDF | 选择您喜欢的插补 RDF、KNN、mean、median、most_frequent、constant。 |
神经网络 |
使用参数的例子
- 将额外的特殊字符附加到现有的 default_list
包装中包含的默认特殊字符如下所示,
default_list = ["!", '"', "#", "%", "&", "'", "(", ")",
"*", "+", ",", "-", ".", "/", ":", ";", "<",
"=", ">", "?", "@", "[", "\\", "]", "^", "_",
"`", "{", "|", "}", "~", "–", "//", "%*", ":/", ".;", "Ø", "§",'$',"£"]
如何删除特殊字符,例如如果要删除“?” 和 ”%”。
注意:- 不要忘记给行动='删除'
from datacleaning import DataCleaning
dp = DataCleaning(file_uploaded='filename.csv', special_character =['?', '%'], action='remove')
cleaned_df = dp.start_cleaning()
如何添加特殊字符,例如,如果您想添加不在上面给出的 default_list 中的“é”。
注意:- 不要忘记给action = 'add'
from datacleaning import DataCleaning
dp = DataCleaning(file_uploaded='filename.csv', special_character =['é'], action='add')
cleaned_df = dp.start_cleaning()
- 忽略特定列并添加特殊字符
例如,需要删除名为“timestamp”和“date”的列,并需要添加一个特殊字符 'é'
from datacleaning import DataCleaning
dp = DataCleaning(file_uploaded='filename.csv', special_character =['é'],
action='add', ignore_columns=['timestamp', 'date'])
cleaned_df = dp.start_cleaning()
- 更改阈值以删除高于此给定阈值的空行/列
from datacleaning import DataCleaning
dp = DataCleaning(file_uploaded='filename.csv', row_threshold=50, col_threshold=90)
cleaned_df = dp.start_cleaning()
- 可用的插补方法
- RDF(随机森林)->(默认)
- KNN(k-最近邻)
- 意思是
- 中位数
- most_frequent
- 持续的
# Example for KNN imputation.
from datacleaning import DataCleaning
dp = DataCleaning(file_uploaded='filename.csv', imputation_type='KNN')
cleaned_df = dp.start_cleaning()
>>谢谢你<<
项目详情
下载文件
下载适用于您平台的文件。如果您不确定要选择哪个,请了解有关安装包的更多信息。
源分布
data-cleaning-1.0.1.tar.gz
(6.7 kB
查看哈希)
内置分布
data_cleaning-1.0.1-py3-none-any.whl
(6.3 kB
查看哈希)
关
data_cleaning -1.0.1-py3-none-any.whl 的哈希值
| 算法 | 哈希摘要 | |
|---|---|---|
| SHA256 | 4cbabc7660edb54b57fb098d5724e30b7890a1d1c7c9ffe24cc07813d4129afd |
|
| MD5 | d1815bf2977b6ba130cf102439351b99 |
|
| 布莱克2-256 | f659f55f4294578d45a72b496b4e61593824fef924195537c28ab97187d8318a |