人工智能训练师(三级)实操考试 — 1.1.3 金融机构信用评估系统中的业务数据审核流程设计

← 返回题目列表 考核时间:30 分钟 30:00
工作任务

某金融机构计划引入智能信用评估系统,通过分析客户的历史交易数据和信用记录,使用机器学习算法预测客户的信用风险等级,从而辅助贷款审批和风险控制。

我们提供一个客户信用数据集(credit_data.csv),包含以下字段:

CustomerID: 客户ID   Name: 客户姓名   Age: 年龄
Income: 收入   LoanAmount: 贷款金额   LoanTerm: 贷款期限(月)
CreditScore: 信用评分   Default: 是否违约(0/1)
TransactionHistory: 历史交易记录(JSON格式)

具体要求

(1)数据完整性审核:检查数据集中的每个字段是否存在缺失值和重复值。截图保存为 1.1.3-1.jpg

(2)数据合理性审核:审核以下字段的合理性:年龄应在18到70岁之间;收入应大于2000;贷款金额应小于收入的5倍;信用评分应在300到850之间。截图保存为 1.1.3-2.jpg

(3)数据清洗:将不合理的数据进行标记,对异常值所在行进行删除,清洗后的数据保存为 cleaned_credit_data.csv

注意事项
  • 在代码的 橙色下划线 处填写正确的 Python 代码
  • 请勿修改源代码的其他部分
  • 填写完成后点击 "检查答案" 查看评分
  • 点击 "显示答案" 可直接查看所有参考答案
  • 点击 "重置" 清空所有填写内容
请在下划线处填写代码
当前得分
0 / 15
In [1] — 导入库 & 读取数据 无填空
import pandas as pd import numpy as np import matplotlib.pyplot as plt # 读取数据集 data = pd.read_csv('credit_data.csv')
In [2] — 数据完整性审核 4分
# 1. 数据完整性审核 # 数据缺失值统计 2分 missing_values = data. # 数据重复值统计 2分 duplicate_values = data. # 输出结果 print("缺失值统计:") print(missing_values) print("重复值统计:") print(duplicate_values)
In [3] — 数据合理性审核 8分
# 2. 数据合理性审核 # Age数据的合理性审核 2分 data['is_age_valid'] = .(18, 70) # Income数据的合理性审核 2分 data['is_income_valid'] = > # LoanAmount数据的合理性审核 2分 data['is_loan_amount_valid'] = < ( * 5) # CreditScore数据的合理性审核 2分 data['is_credit_score_valid'] = .(300, 850) # 合理性检查结果 validity_checks = data[['is_age_valid', 'is_income_valid', 'is_loan_amount_valid', 'is_credit_score_valid']].all(axis=1) data['is_valid'] = validity_checks # 输出结果 print("数据合理性检查:") print(data[['is_age_valid', 'is_income_valid', 'is_loan_amount_valid', 'is_credit_score_valid', 'is_valid']].describe())
In [4] — 数据清洗和异常值处理 3分
# 3. 数据清洗和异常值处理 # 标记不合理数据 invalid_rows = data[~data['is_valid']] # 删除不合理数据行 cleaned_data = data[data['is_valid']] # 删除标记列 cleaned_data = cleaned_data.drop(columns=['is_age_valid', 'is_income_valid', 'is_loan_amount_valid', 'is_credit_score_valid', 'is_valid']) # 保存清洗后的数据 3分 .(, index=False) print("数据清洗完成,已保存为 'cleaned_credit_data.csv'")
答案检查结果