人工智能训练师(三级)实操考试 — 2.1.2 低碳生活行为影响因素数据清洗和标注流程设计

← 返回题目列表 考核时间:20 分钟 20:00
工作任务

在应对气候变化的背景下,了解和促进低碳生活行为变得越来越重要。现要求根据提供的"大学生低碳生活行为的影响因素数据集",选择合适的特征,开发一个预测大学生低碳生活行为的模型。

数据集包含300多个样本,自变量为主观规范、知觉行为控制、低碳行为态度,中介变量为行为意愿,因变量为低碳生活行为。性别、生源地、月生活费作为控制变量。

具体要求

(1)正确加载数据集,并显示前五行的数据;

(2)检查数据集中的缺失值,使用删除包含缺失值的行的办法处理,记录缺失值处理后的数据行数;

(3)检查数据集中的重复值并删除所有重复值,并记录删除的行数;

(4)对数值型数据进行标准化处理,确保数据在同一量纲下进行分析;

(5)根据业务需求和数据特性,选择对低碳生活行为预测最有用的特征,将"低碳行为积极性"设为目标变量并标注;

(6)对数据进行划分(8:2);

(7)保存处理后的数据,并命名为:2.1.2_cleaned_data.csv。

注意事项
  • 在代码的 橙色下划线 处填写正确的 Python 代码
  • 请勿修改源代码的其他部分
  • 填写完成后点击 "检查答案" 查看评分
  • 点击 "显示答案" 可直接查看所有参考答案
  • 点击 "重置" 清空所有填写内容
请在下划线处填写代码
当前得分
0 / 20
In [1] — 导入库 & 读取数据 2分
import pandas as pd # 读取一个Excel文件,并将读取到的数据存储在变量data中 data = # 打印出数据集的前5行 print(data.head())
In [2] — 缺失值处理 4分
# 处理数据集中的缺失值 initial_row_count = # 处理前的数据行数 data = # 删除缺失值所在行 final_row_count = # 处理后的数据行数 print(f'处理后数据行数: {final_row_count}, 删除的行数: {initial_row_count - final_row_count}')
In [3] — 重复值处理 & 标准化 3分
# 删除重复行 data = from sklearn.preprocessing import StandardScaler numerical_features = ['4.您的月生活费○≦1,000元 ○1,001-2,000元 ○2,001-3,000元 ○≧3,001元'] scaler = StandardScaler() data[numerical_features] =
In [4] — 特征选择 & 目标变量 5分
# 选择特征 selected_features = [] X = # 创建目标变量 y =
In [5] — 数据划分 3分
from sklearn.model_selection import train_test_split # 数据划分(测试集取20%) X_train, X_test, y_train, y_test = , random_state=42)
In [6] — 合并保存数据 3分
# 合并处理后的数据,并将其保存(保存中不用额外创建索引) cleaned_data = (, axis=1) ('2.1.2_cleaned_data.csv', )
答案检查结果