人工智能训练师(三级)实操考试 — 2.1.1 智慧交通中燃油效率模型的数据清洗和标注流程设计

← 返回题目列表 考核时间:20 分钟 20:00
工作任务

在现代交通中,燃油效率(MPG)是衡量汽车性能和交通系统优化的重要指标之一。高效的燃油利用不仅能够降低车辆运营成本,还能减少碳排放,促进环保。

现要求根据提供的汽车燃油效率数据集(auto-mpg.csv),选择合适的特征,开发一个燃油效率预测模型。在开发预测模型之前,首先要对数据进行数据清洗和标注。

具体要求

(1)正确加载数据集,并显示前五行的数据及数据类型。

(2)检查数据集中的缺失值并删除缺失值所在的行。

(3)将"horsepower"列转换为数值类型,并处理转换中的异常值。

(4)对数值型数据进行标准化处理,确保数据在同一量纲下进行分析。

(5)选择特征:'cylinders'、'displacement'、'horsepower'、'weight'、'acceleration'、'model year'、'origin'

(6)将"mpg"设为目标变量并标注。

(7)对数据进行标注和划分(训练集占8成)。

(8)保存处理后的数据为 2.1.1_cleaned_data.csv(不存储额外的索引号)。

注意事项
  • 在代码的 橙色下划线 处填写正确的 Python 代码
  • 请勿修改源代码的其他部分
  • 填写完成后点击 "检查答案" 查看评分
  • 点击 "显示答案" 可直接查看所有参考答案
  • 点击 "重置" 清空所有填写内容
请在下划线处填写代码
当前得分
0 / 9
In [1] — 加载数据集并显示前五行 1分
import pandas as pd # 加载数据集并显示数据集的前五行 1分 data = print("数据集的前五行:") print() # 显示每一列的数据类型 print(data.dtypes)
In [2] — 检查缺失值并删除 2分
# 检查缺失值并删除缺失值所在的行 2分 print("\n检查缺失值:") print(..) data =
In [3] — 转换 horsepower 列并处理异常值 1分
# 将 'horsepower' 列转换为数值类型,并(删除)处理转换中的异常值 1分 data['horsepower'] = (data['horsepower'], errors='coerce') data = # 显示每一列的数据类型 print(data.horsepower.dtypes) # 检查清洗后的缺失值 print("\n检查清洗后的缺失值:") print(data.isnull().sum())
In [4] — 对数值型数据进行标准化处理 1分
from sklearn.preprocessing import StandardScaler # 对数值型数据进行标准化处理 1分 numerical_features = ['displacement', 'horsepower', 'weight', 'acceleration'] scaler = StandardScaler() data[numerical_features] =
In [5] — 选择特征、自变量和目标变量 2分
from sklearn.model_selection import train_test_split # 选择特征、自变量和目标变量 2分 selected_features = X = y =
In [6] — 划分训练集和测试集 1分
# 划分数据集为训练集和测试集(训练集占8成) 1分 X_train, X_test, y_train, y_test = ( random_state=42)
In [7] — 保存处理后的数据 1分
# 将特征和目标变量合并到一个数据框中 cleaned_data = X.copy() cleaned_data['mpg'] = y # 保存清洗和处理后的数据(不存储额外的索引号) 1分 ('2.1.1_cleaned_data.csv', ) # 打印消息指示文件已保存 print("\n清洗后的数据已保存到 2.1.1_cleaned_data.csv")
答案检查结果