组队学习——决策树(以泰坦尼克号公共数据集为例)
创始人
2024-12-15 21:38:13
0

本次我们挑战的数据集为泰坦尼克号公共数据集,为了降低难度,我们在原有数据集的基础上进行了优化,具体数据集介绍如下:

在这里也介绍一下数据的含义吧
数据介绍:

Survived:是否存活(label)
Pclass(用户阶级):1 - 1st class,高等用户;2 - 2nd class,中等用户;3 - 3rd class,低等用户;
Name(名字)
Sex(性别)
Age(年龄)
Siblings/Spouses Aboard:描述了泰坦尼克号上与乘客同行的兄弟姐妹(Siblings)和配偶(Spouse)数目;
Parents/Children Aboard:描述了泰坦尼克号上与乘客同行的家长(Parents)和孩子(Children)数目;
Fare(乘客费用)

第一步:导入必要的库

import numpy as np import pandas as pd import matplotlib.pyplot as plt import seaborn as sns from sklearn.model_selection import train_test_split from sklearn.preprocessing import StandardScaler from sklearn.tree import DecisionTreeClassifier from sklearn.metrics import accuracy_score, classification_report

 第二步:加载并分析数据

观察是否有缺失值和异常值(异常值需要根据具体的题目条件来判断),若有缺失值和异常值进行第三步数据预处理

# 加载数据集 path = "E:\\Jupyter Workspace\\数学建模\\titanic.csv" data = pd.read_csv(path)  # 显示数据的前几行 data.head() # 查看数据的详细信息 data.info()

第三步:数据预处理

 首先删除不必要的特征如名字(可能有用,比如有些人名在那个时代只有贵族能用或者只有穷人能用,但本体不考虑这些因素)

# 删除不需要的特征 data = data.drop(["Name"], axis=1)

若有缺失值可以进行如下操作,如用中位数填充

# 填充数值特征的缺失值 data["Age"].fillna(data["Age"].median(), inplace=True) data["Fare"].fillna(data["Fare"].median(), inplace=True)

若遇到分类变量特征,可以进行独热编码

# 对分类特征进行独热编码 data = pd.get_dummies(data, columns=["Sex"], drop_first=True)

思考一下:分类变量分类为两类的时候可以drop_first,那如果100类呢?该采用哪些方法来处理这个分类变量特征呢?

第四步:划分自变量(X)和因变量(y)

# 分割数据为特征(X)和目标(y) X = data.drop("Survived", axis=1) y = data["Survived"]

第五步:训练模型

在训练模型之前,需要将数据集划分为训练集和测试集(本题由于没有要预测的部分,就把数据集中0.2比例的验证集当做测试集进行模型的验证)

# 将数据集分割为训练集和测试集 X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

在放入模型前,先对上述特征进行标准化处理(大家思考一下这个操作是为什么呢?)

# 特征标准化处理 scaler = StandardScaler() X_train = scaler.fit_transform(X_train) X_test = scaler.transform(X_test)

创建决策树模型分类器进行训练

# 创建决策树分类器并进行训练 model2 = DecisionTreeClassifier(random_state=42) model2.fit(X_train, y_train)

第六步:模型的性能指标评价

# 在测试数据上进行预测 y_pred = model2.predict(X_test)  # 计算准确性 accuracy = accuracy_score(y_test, y_pred) print("模型准确性:", accuracy)  # 生成分类报告 report = classification_report(y_test, y_pred) print("分类报告:\n", report)

相关内容

热门资讯

正版授权“金花链接房卡在哪里弄... 众乐大厅是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:86909166许多玩家在游戏中会购买房卡来...
微信开金花群房卡到哪里买/金花... 金花是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:44346008许多玩家在游戏中会购买房卡来享受...
hi8pro安卓系统,功能解析... 亲爱的数码爱好者们,你是否对安卓系统有着浓厚的兴趣?今天,我要给你带来一款特别引人注目的产品——hi...
秒懂教程“如何创建金花房间链接... 新九哥牛牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:160470940许多玩家在游戏中会购买房...
金花链接房卡怎么创建房间/微信... 牛牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:160470940许多玩家在游戏中会购买房卡来享...
牛牛在哪里购买房卡/微信金花房... 牛牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:86909166许多玩家在游戏中会购买房卡来享受...
好用的安卓系统电脑版,好用功能... 你有没有想过,手机上的安卓系统那么好用,要是能直接在电脑上用,那该多方便啊!没错,今天就要给你揭秘一...
微信炸金花链接怎样弄/炸金花房... 微信炸金花是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:15984933许多玩家在游戏中会购买房卡...
微信牛牛房卡招代理/微信链接牛... 牛牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:160470940许多玩家在游戏中会购买房卡来享...
秒懂教程“金花客服代理房卡获取... 随意玩是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:86909166许多玩家在游戏中会购买房卡来享...
微信链接金花房卡怎么弄/微信金... 金花是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:44346008许多玩家在游戏中会购买房卡来享受...
给大家讲解“金花房卡在哪里能弄... 乐酷大厅是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:44346008许多玩家在游戏中会购买房卡来...
微信开金花群房卡到哪里买/微信... 牛牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:44346008许多玩家在游戏中会购买房卡来享受...
在哪里买炸金花房卡哪家便宜/链... 金花是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:86909166许多玩家在游戏中会购买房卡来享受...
房卡必备教程“在哪里买炸金花房... 新道游是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:86909166许多玩家在游戏中会购买房卡来享...
一分钟了解“金花游戏房卡怎么获... 新众亿金花是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:15984933许多玩家在游戏中会购买房卡...
安卓怎么刷其他的系统,安卓设备... 你有没有想过给你的安卓手机换换口味呢?是的,你没听错,就是刷机!刷机,顾名思义,就是将手机系统进行更...
上下分金花牛牛房卡怎么冲/微信... 斗牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:44346008许多玩家在游戏中会购买房卡来享受...
一分钟了解“炸金花房卡链接怎么... 大圣大厅是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:86909166许多玩家在游戏中会购买房卡来...
微信牛牛房卡要怎么弄/微信牛牛... 牛牛是一款非常受欢迎的棋牌游戏,咨询房/卡添加微信:15984933许多玩家在游戏中会购买房卡来享受...