Datawhale练习之二手车价格预测-巨人网络通讯

1. 总览数据概况

数据库载入

#coding:utf-8
#导入warnings包，利用过滤器来实现忽略警告语句。
import warnings
warnings.filterwarnings('ignore')
import pandas as pd
import numpy as np
import matplotlib.pyplot as plt
import seaborn as sns
import missingno as msno

数据载入

## 1) 载入训练集和测试集；
path = './'
Train_data = pd.read_csv(path+'car_train_0110.csv', sep=' ')
Test_data = pd.read_csv(path+'car_testA_0110.csv', sep=' ')

确定path，如果是在notebook环境，我通常使用！dir查看当前目录

特征说明

新技能：使用.append（）同时观察前5行与后5行

## 2) 简略观察数据(head()+shape)
Train_data.head().append(Train_data.tail())

观察数据维度

Train_data.shape，Test_data.shape

总览概况: .describe（）查看统计量，.info（）查看数据类型

1.1 判断数据缺失和异常

1.1.1 查看nan

Train_data.shape，Test_data.shape

也可直接查看nan，有以下两种方式 ↓ ：

Train_data.isnull().sum()

可视化na更直观

# find na 
tmp = df_train.isnull().any()
tmp[tmp.values==True]

新技能： msno库(缺失值可视化)的使用

Train_data.isnull().sum().plot( kind= 'bar')

可视化看下缺省值

msno.matrix(Train_data.sample(250))

其中，Train_data.sample(250)表示随机抽样250行，白色条纹表示缺失

直接显示未缺失的样本数量/每特征

msno.bar(Train_data.sample(250),labels= True)

使用msno中的 .heatmap()查看缺失值之间的相关性

msno.heatmap(Train_data.sample(250))

1.1.2 *异常值检测（重要！易忽略）

通过Train_data.info()了解数据类型

Train_data.info()

1.2 了解预测值的分布

特征分为类别特征和数字特征

查看分布的意义在于：

a. 及时将非正态分布数据变化为正态分布数据

b. 异常检测

1.2.1 数字特征分析

Train_data['price']

发现都是int

统计分布 ↓

Train_data['price'].value_counts()

## 1) 总体分布概况（无界约翰逊分布等）
import scipy.stats as st
y = Train_data['price']
plt.figure(1); plt.title('Johnson SU')
sns.distplot(y, kde=False, fit=st.johnsonsu)
plt.figure(2); plt.title('Normal')
sns.distplot(y, kde=False, fit=st.norm)
plt.figure(3); plt.title('Log Normal')
sns.distplot(y, kde=False, fit=st.lognorm)

结论：price不服从正态分布，因此在进行回归之前，它必须进行转换。无界约翰逊分布拟合效果较好。

1.2.1.1 相关性分析

1.2.1.2 *偏度和峰值

偏度（skewness），统计数据分布偏斜方向和程度，是统计数据分布非对称程度的数字特征。定义上偏度是样本的三阶标准化矩。

峰度（peakedness；kurtosis）又称峰态系数。表征概率密度分布曲线在平均值处峰值高低的特征数。直观看来，峰度反映了峰部的尖度。

## 2) 查看skewness and kurtosis
sns.distplot(Train_data['price']);
print("Skewness: %f" % Train_data['price'].skew())
print("Kurtosis: %f" % Train_data['price'].kurt())

批量计算skew

Train_data.skew()

查看skew的分布情况

批量计算kurt

Train_data.kurt()

查看kurt的分布情况

查看目标变量的分布

## 3) 查看预测值的具体频数
plt.hist(Train_data['price'], orientation = 'vertical',histtype = 'bar', color ='red')
plt.show()

结论：大于20000得值极少，其实这里也可以把这些当作特殊得值（异常值）直接用填充或者删掉

由于np.log(0)==-inf，无法绘图，因此改用log(1+x)绘制分布bar，和教程里有出入，教程里用log绘图如下：（我画不出来，因为-inf会报错）

# log变换之后的分布较均匀，可以进行log变换进行预测，这也是预测问题常用的trick
plt.hist(np.log(1+Train_data['price']), orientation = 'vertical',histtype = 'bar', color ='red') 
plt.show()

分离label即预测值

Y_train = Train_data['price']

#这个区别方式适用于没有直接label coding的数据

#这里不适用，需要人为根据实际含义来区分

#数字特征

numeric_features = Train_data.select_dtypes(include=[np.number])

numeric_features.columns

#类型特征

categorical_features = Train_data.select_dtypes(include=[np.object])

categorical_features.columns

numeric_features = ['power', 'kilometer', 'v_0', 'v_1', 'v_2', 'v_3', 'v_4', 'v_5', 'v_6', 'v_7', 'v_8', 'v_9', 'v_10', 'v_11', 'v_12', 'v_13','v_14' ]
categorical_features = ['name', 'model', 'brand', 'bodyType', 'fuelType', 'gearbox', 'notRepairedDamage', 'regionCode',]

# 特征nunique分布
for cat_fea in categorical_features:
    print(cat_fea + "的特征分布如下：")
    print("{}特征有个{}不同的值".format(cat_fea, Train_data[cat_fea].nunique()))
    print(Train_data[cat_fea].value_counts())

每个特征情况都会逐个如下所示：

test data显示同理

numeric_features.append('price')
numeric_features

price_numeric = Train_data[numeric_features]
correlation = price_numeric.corr()
correlation

只截了一部分

查看相关性（强->弱）

print(correlation['price'].sort_values(ascending = False),'\n')

可视化correction

f , ax = plt.subplots(figsize = (7, 7))
plt.title('Correlation of Numeric Features with Price',y=1,size=16)
sns.heatmap(correlation,square = True,  vmax=0.8)

price完成历史使命，删掉

del price_numeric['price']

## 2) 查看几个特征得 偏度和峰值
for col in numeric_features:
    print('{:15}'.format(col), 
          'Skewness: {:05.2f}'.format(Train_data[col].skew()) , 
          '   ' ,
          'Kurtosis: {:06.2f}'.format(Train_data[col].kurt())  
         )

1.2.1.3 *每个数字特征的分布可视化（易忽略）

## 3) 每个数字特征得分布可视化
f = pd.melt(Train_data, value_vars=numeric_features)
g = sns.FacetGrid(f, col="variable",  col_wrap=2, sharex=False, sharey=False)
g = g.map(sns.distplot, "value")

只截了部分：

结论：匿名特征（v_*）相对分布均匀

1.2.1.4 *数字特征相互之间的关系可视化（易忽略）

## 4) 数字特征相互之间的关系可视化
sns.set()
columns = ['price', 'v_12', 'v_8' , 'v_0', 'power', 'v_5',  'v_2', 'v_6', 'v_1', 'v_14']
sns.pairplot(Train_data[columns],size = 2 ,kind ='scatter',diag_kind='kde')
plt.show()

1.2.1.5 *多变量互相回归关系可视化（易忽略）

## 5) 多变量互相回归关系可视化
fig, ((ax1, ax2), (ax3, ax4), (ax5, ax6), (ax7, ax8), (ax9, ax10)) = plt.subplots(nrows=5, ncols=2, figsize=(24, 20))
# ['v_12', 'v_8' , 'v_0', 'power', 'v_5',  'v_2', 'v_6', 'v_1', 'v_14']
v_12_scatter_plot = pd.concat([Y_train,Train_data['v_12']],axis = 1)
sns.regplot(x='v_12',y = 'price', data = v_12_scatter_plot,scatter= True, fit_reg=True, ax=ax1)
v_8_scatter_plot = pd.concat([Y_train,Train_data['v_8']],axis = 1)
sns.regplot(x='v_8',y = 'price',data = v_8_scatter_plot,scatter= True, fit_reg=True, ax=ax2)
v_0_scatter_plot = pd.concat([Y_train,Train_data['v_0']],axis = 1)
sns.regplot(x='v_0',y = 'price',data = v_0_scatter_plot,scatter= True, fit_reg=True, ax=ax3)
power_scatter_plot = pd.concat([Y_train,Train_data['power']],axis = 1)
sns.regplot(x='power',y = 'price',data = power_scatter_plot,scatter= True, fit_reg=True, ax=ax4)
v_5_scatter_plot = pd.concat([Y_train,Train_data['v_5']],axis = 1)
sns.regplot(x='v_5',y = 'price',data = v_5_scatter_plot,scatter= True, fit_reg=True, ax=ax5)
v_2_scatter_plot = pd.concat([Y_train,Train_data['v_2']],axis = 1)
sns.regplot(x='v_2',y = 'price',data = v_2_scatter_plot,scatter= True, fit_reg=True, ax=ax6)
v_6_scatter_plot = pd.concat([Y_train,Train_data['v_6']],axis = 1)
sns.regplot(x='v_6',y = 'price',data = v_6_scatter_plot,scatter= True, fit_reg=True, ax=ax7)
v_1_scatter_plot = pd.concat([Y_train,Train_data['v_1']],axis = 1)
sns.regplot(x='v_1',y = 'price',data = v_1_scatter_plot,scatter= True, fit_reg=True, ax=ax8)
v_14_scatter_plot = pd.concat([Y_train,Train_data['v_14']],axis = 1)
sns.regplot(x='v_14',y = 'price',data = v_14_scatter_plot,scatter= True, fit_reg=True, ax=ax9)
v_13_scatter_plot = pd.concat([Y_train,Train_data['v_13']],axis = 1)
sns.regplot(x='v_13',y = 'price',data = v_13_scatter_plot,scatter= True, fit_reg=True, ax=ax10)

1.2.2 类别特征分析（会画，不会利用结果）

对类别特征查看unique分布

.value_counts()

## 1) unique分布
for fea in categorical_features:
    print(Train_data[fea].nunique())
categorical_features

1.2.2.1 箱形图可视化

## 2) 类别特征箱形图可视化
# 因为 name和 regionCode的类别太稀疏了，这里我们把不稀疏的几类画一下
categorical_features = ['model',
 'brand',
 'bodyType',
 'fuelType',
 'gearbox',
 'notRepairedDamage']
for c in categorical_features:
    Train_data[c] = Train_data[c].astype('category')
    if Train_data[c].isnull().any():
        Train_data[c] = Train_data[c].cat.add_categories(['MISSING'])
        Train_data[c] = Train_data[c].fillna('MISSING')
def boxplot(x, y, **kwargs):
    sns.boxplot(x=x, y=y)
    x=plt.xticks(rotation=90)
f = pd.melt(Train_data, id_vars=['price'], value_vars=categorical_features)
g = sns.FacetGrid(f, col="variable",  col_wrap=2, sharex=False, sharey=False, size=5)
g = g.map(boxplot, "value", "price")

Train_data.columns

1.2.2.2 小提琴图可视化

## 3) 类别特征的小提琴图可视化
catg_list = categorical_features
target = 'price'
for catg in catg_list :
    sns.violinplot(x=catg, y=target, data=Train_data)
    plt.show()

categorical_features = ['model',
 'brand',
 'bodyType',
 'fuelType',
 'gearbox',
 'notRepairedDamage']

1.2.2.3 柱形图可视化类别

## 4) 类别特征的柱形图可视化
def bar_plot(x, y, **kwargs):
    sns.barplot(x=x, y=y)
    x=plt.xticks(rotation=90)
f = pd.melt(Train_data, id_vars=['price'], value_vars=categorical_features)
g = sns.FacetGrid(f, col="variable",  col_wrap=2, sharex=False, sharey=False, size=5)
g = g.map(bar_plot, "value", "price")

1.2.2.4 特征的每个类别频数可视化(count_plot)

##  5) 类别特征的每个类别频数可视化(count_plot)
def count_plot(x,  **kwargs):
    sns.countplot(x=x)
    x=plt.xticks(rotation=90)
f = pd.melt(Train_data,  value_vars=categorical_features)
g = sns.FacetGrid(f, col="variable",  col_wrap=2, sharex=False, sharey=False, size=5)
g = g.map(count_plot, "value")

2. *用pandas_profiling生成数据报告(新技能)

import pandas_profiling

pfr = pandas_profiling.ProfileReport(Train_data)
pfr.to_file("./example.html")

3. 小结

本次笔记虽然针对样本量较少的情况，但仍有一些可贵的思路：

a. 通过检查nan缺失情况，确定需要进一步处理的特征：

填充（填充方式是什么，均值填充，0填充，众数填充等）；

舍去；

先做样本分类用不同的特征模型去预测。

b. 通过分布，进行异常检测

分析特征异常的label是否异常（或者偏离均值较远或者事特殊符号）；

异常值是否应该剔除，还是用正常值填充，等。

c. 通过对laebl作图，分析标签的分布情况

d. 通过对特征作图，特征和label联合做图（统计图，离散图），直观了解特征的分布情况，通过这一步也可以发现数据之中的一些异常值等，通过箱型图分析一些特征值的偏离情况，对于特征和特征联合作图，对于特征和label联合作图，分析其中的一些关联性

到此这篇关于Datawhale练习的文章就介绍到这了,更多相关python预测内容请搜索脚本之家以前的文章或继续浏览下面的相关文章,希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

利用机器学习预测房价
如何用Python进行时间序列分解和预测
利用keras使用神经网络预测销量操作
详解用Python进行时间序列预测的7种方法
Python实现新型冠状病毒传播模型及预测代码实例

标签：阳泉金华日照贵州克拉玛依临汾赤峰双鸭山

巨人网络通讯声明：本文标题《Datawhale练习之二手车价格预测》，本文关键词 Datawhale,练,习之,二手车,；如发现本文内容存在版权问题，烦请提供相关信息告之我们，我们将及时沟通与处理。本站内容系统采集于网络，涉及言论、版权与本站无关。

下面列出与本文章《Datawhale练习之二手车价格预测》相关的同类信息！

Datawhale练习之二手车价格预测

目录 1. 总览数据概况 1.1 判断数据缺失和异常 1.1.1 查看nan 1.1.2 *异常值检测（重要！易忽略） 1.2 了解预测值的分布 1.2.1 数字特征分析 1.2.2 类别特征分析（会画，不会利用结果） 2. *用...

10-18

许昌手机外呼系统（电销手机外呼系统）

本文目录一览：1、外呼体系是怎样用的？2、外呼体系怎样用？我也是做电销的，打电话打多了就会被封号3、什么是网络电话...

11-29

商务部与加拿大中国贸易理事会服务外包合作交流会成功举行

10月4日，商务部与加中贸易理事会在加拿大多伦多举办了2013年中加服务外包合作交流会。加中贸易理事会Neil Tait副主席和中...

10-22

400电话续费的套餐还是和以前一样的吧？

400电话新续费的套餐跟之前签订的合同是一样的，除非您要提高续费的标准，只能提高不能降低。...

12-22

新一线城市研究所、ofo联合发布：南京每天超2千人骑车起点为新街口地铁

第一财经·新一线城市研究所与ofo小黄车最新联合发布了“共享单车城市出行大数据”，并解读了南京整座城市的共享单车出...

10-16

黑龙江电销外呼系统好用吗（电销外呼系统哪个

本文目录一览：1、外呼体系好用吗？2、电销客外呼体系这个体系好用么？3、外呼体系怎么？好用么？4、外呼体系好用不?哪...

11-29

电销机器人对电销行业有着积极的促进作用

电销机器人对电销行业有着积极的促进作用，电销机器人，让客户服务体验更顺畅。电销机器人外呼系统颠覆传统自动外呼只...

10-31

电话机器人有法律效应（电话机器人违法吗）

本文目录一览：1、076912345打电话是机器人会不会坐牢2、公司老板把电话号码数据给我导入到电话机器人群呼系,我会涉嫌违法...

06-20

极光大数据：国内手机市场年中大盘点

2017 年第二季度，苹果十周年新机型蓄势待发。安卓阵营华为卫冕销量冠军，vivo则登上亚军宝座。中国领先的移动大数据办事...

10-16

智呼宝ai电话机器人（电话智能机器人）

本文目次一览： 1、什么是AI智能德律风呆板人？ 2、智能德律风呆板人可行吗？ 3、AI智能德律风呆板人 4、ai智能德律风呆板...

11-25

云呼叫中心年增近20% 获电商企业青睐

中国软件资讯网消息，近期，基于云计算技术的呼叫中心受到业界的关注，并逐步成为了企业发展电子商务的新动力。由于云...

10-22

东莞财税专用ai电话机器人价格-哪家专业？

东莞财税专用ai电话机器人价格反正我是无法理解的。值得一提的是在这份榜单中，呼叫中心系统服务商的表现给人眼前一亮...

05-17

电销团队海报手绘（电销团队名称和激励口号）

本文目录一览： 1、海报怎样画手绘2、制造手绘POP海报的6大过程与技巧3、手绘POP海报的过程及技巧4、怎样手绘pop海报5、手...

04-22

电销防封软件真的可以防封号吗?

现在的电销行业越来越难做了，原因无他，就是运营商封号太严重了。每天打不了多少电话就会有封号的危险。这对电销业务...

12-03

为什么企业对 400 电话感兴趣？（企业对400电话感兴趣原因是什么）

很多企业都非常重视电话业务，所以选择一个非常合适的电话号码对企业来说也很重要企业对400电话感兴趣原因是什么在掌...

07-21

联通400电话固定费用400电话办理具体的收费标准是什么？

作为全国统一的强大虚拟总机，400电话号码没有9位数字，都是从400开始的，但是运营商不同，数字段不同。联通400电话目前...

01-13

电销团队怎么抓人（电销团队犯法吗）

今天给各位分享电销团队怎么抓人的知识，其中也会对电销团队犯法吗进行解释，如果能碰巧解决你现在面临的问题，别忘了...

08-27

南京房产外呼电话一企嗨呼叫系统,AXB线路厂家-实力认证

一企嗨电话营销系统 1．当前的电销场景有哪些困扰？ 1）手机.卡频繁被封，电销业务难以启动； 2）销售人员号码被标注，...

12-17

如何获得没有地图标注商家信息？如何获得位置信息？

C#如何获得百度地图点上的信息框？百度地图是提供了一个js API 你需要什么需要用js获取，在ajax发到后台去如何采集百度地...

11-26

PowerShell ISE自动化简单示例

PowerShell ISE的自动化不依赖与任何第三方的框架和工具，因为PowerShell ISE本身就是可编程的。非常高大上地被称作为PowerShell抽...

10-18

Javascript中使用exec进行正则表达式全局匹配时的注意事项

本文就是介绍在使用 Javascript 中使用 exec 进行正则表达式全局匹配时的注意事项。先看一下常见的用法：复制代码代码如下...

10-18

中牟百应电销机器人加盟（中牟百应电销机器人

本文目录一览：1、跟电话机器人公司协作,上圈套了怎么办2、为什么越来越多的人挑选电话机器人项目创业3、电话机器人...

11-29

中高端服务外包人才来锡创业可获安家费补贴

无锡服务外包企业若获得世界500强企业的大额外包合同，本地工业企业若向123计划企业发包，符合这样的条件都将得到奖励。...

10-22

苏州电销机器人免费领（智能电销机器人购买）

本篇文章给我们谈谈姑苏电销机器人免费领，以及智能电销机器人购买对应的知识点，期望对各位有所协助，不要忘了保藏本...

11-06

观察呼叫中心外包运营有感

09年6月下旬的某日，盆地中的台北天气闷热，电脑惯例地持续收到各方邮件。刚巧公务缠身，本想只要不是紧急状况就先搁着...

10-22

苏州电销机器人哪家有卖（苏州家用机器人）

本文目录一览： 1、电话销售机器人哪个好2、电销机器人都有哪些性价比高的品牌？3、电话ai机器人在哪能买4、电销机器人...

11-27

400电话，走进行业领先的推广

400电话，这是一个选择永久性号码的平台，也是很多行业进入到发展阶段过程中所需要把握的一种宣传模式，到底怎么样才能...

03-12

400电话中国移动移动400电话怎么样

移动400业务就是互联网上提到的400电话，类似于800电话，都是提供给企业的直线电话业务。与800不同的是，400电话是一项业...

01-13

丽水电销机器人厂家

汇港通科技组装于2018年，是一家潜心于大中小企业精准经营销售和企业管理效劳处置计划的供给商。呼叫中心经营管理，巨...

10-31

上海电销公司外呼用什么软件

上海电销公司外呼用什么软件,办理上海电销外呼软件,上海电销软件办理防封号电销软件，提供多种防封解决方案，支持各地...

12-03

电销外呼线路都有哪些

电销外呼线路都有哪些优质的电销线路，全国套餐可选。企业呼叫中心、业务系统统一接入。解决封号难题，提供呼出率！...

12-03

关于大都会人寿电销是外包么的信息

本篇文章给大家谈谈大都会人寿电销是外包么，以及对应的知识点，希望对各位有所帮助，不要忘了收藏本站喔。本文目录...

08-28

外呼系统外地手机号（外呼电话号码）

本文目录一览： 1、外埠手机号码一天拨打20个外埠号码会封号么？ 2、外呼体系若何用？我也是做电销的，打电话打多了就会...

11-26

保定市防封高频电话卡便宜

全国建“合伙人”制分公司有了战略和产品，开拓用户是分享通信集团下一步的重心。据了解，分享通信集团以“分享”的理...

02-15

$[city_name]电销卡哪里购买好（电销电话卡哪个比较便宜）

今天给各位分享电销卡哪里购买好的知识，其中也会对电销电话卡哪个比较便宜进行解释，如果能碰巧解决你现在面临的问题...

06-02

400电话资费400元电话资费标准

400电话资费400元电话资费标准以下内容由巨人小编整理发布。 50元/月，83元/月，138元/月。400电话已经成为企业的必须品，...

02-20

长沙电销外呼系统介绍（呼叫中心电销系统）

本篇文章给大家谈谈长沙电销外呼系统介绍，以及呼叫中心电销系统对应的知识点，希望对各位有所帮助，不要忘了收藏本站...

11-06

伊娃机器人效果怎么样

时代在发展，科技在进步，无论你的企业在行业中处于什么样的地位，无论你的企业在市场上占多大的份额，无论你的企业在...

10-31

佛山销售外呼系统收费（外呼营销违法吗）

本文目录一览： 1、外呼体系多少钱一个月？2、电销外呼体系多少钱一个月？3、电销外呼体系一个月贵吗？4、外呼体系装置...

04-22

加速AI应用，思必驰在2019全球人工智能产品应用博览会

5月9日，由苏州市人民政府、新一代人工智能产业技术创新战略联盟共同主办的2019全球人工智能产品应用博览会（以下简称全...

10-19

网上购买物联卡靠谱吗

在这个万物互联的时代，针对于企业设备联网的物联卡就显得格外重要了，而共享单车，移动支付，智慧城市，自动售卖机等...

11-07

品牌商标转让一般要多少天才能进行使用？

现在要以什么样的方式，才可以快速完成品牌商标转让流程呢？对此有疑问的朋友，只要不断了解相关的事情，很快就会知...

10-23

微软颁布颁发为Win10秋季更新10586延长6个月更新支持

目前，Windows10 共计有 5 个正式版，从Version 1507(Build 10240)到最新的1709(Build16299 秋季创意者更新)。因为敦促升级的缘故，微软...

10-15

办理400电话打破企业“生死劫”（企业400电话办理怎样做）

11-07

linux学习笔记

linux目录架构 / 根目录 /bin 常用的命令 binary file 的目錄 /boot 存放系统启动时必须读取的档案，包括核心 (kernel) 在内 /boot/gr...

10-20

centos安装php5、卸载php、安装php7的教程

首先安装php5很简单 yum install php 然后如果不想用php5的话那就卸载吧注意只使用yum remove命令是行不通的那我们先 yum remove p...

10-16

徐州电话机器人厂家招聘（江苏机器人厂招聘）

本文目录一览： 1、怎么查询个人征信报告？ 2、越来越多人做电销机器人了，电销机器人哪家好呢？ 3、没有用的比较好的电...

11-25

南通高频电销卡批发

南通高频电销卡批发本公司目前已经与多家虚拟运营商联签约，共创虚商大业，提供了业务整合的平台！服务宗旨：只给客...

11-15

化妆品商标注册

化妆品作为一种品牌盈利能力很强的产品，商标注册显然是最重要的。销售的作用反而是其次，生产环节的盈利能力最差。从...

10-23

杭州电话外呼系统价格（杭州呼叫中心）

本文目次一览： 1、外呼零碎几何钱一个月？ 2、德律风外呼零碎几何钱？ 3、电销外呼零碎几何钱一个月？ 4、外呼零碎一个...

11-25

郑州防封卡外呼系统是什么（外呼防封号系统）

本文目录一览： 1、什么是网络电话外呼体系？2、外呼体系是什么?3、外呼体系是怎样用的？什么是网络电话外呼体系？你加...

11-28

Datawhale练习之二手车价格预测

10-18

本页收集关于Datawhale练习之二手车价格预测的相关信息资讯供网民参考！

在线咨询

Datawhale练习之二手车价格预测

目录

1. 总览数据概况

1.1 判断数据缺失和异常

1.1.1 查看nan

1.1.2 *异常值检测（重要！易忽略）

1.2 了解预测值的分布

1.2.1 数字特征分析

1.2.1.1 相关性分析

1.2.1.2 *偏度和峰值

1.2.1.3 *每个数字特征的分布可视化（易忽略）

1.2.1.4 *数字特征相互之间的关系可视化（易忽略）

1.2.1.5 *多变量互相回归关系可视化（易忽略）

1.2.2 类别特征分析（会画，不会利用结果）

1.2.2.1 箱形图可视化

1.2.2.2 小提琴图可视化

2. *用pandas_profiling生成数据报告(新技能)

3. 小结

四合一精品企业网站建设

¥888元限时抢购

立即咨询 快速购买

企业400电话

合计11份范本：公司章程+合伙协议+出资协议+合作协议+股权转让协议+增资扩股协议+股权激励+股东会决议+董事会决议