{
 "cells": [
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "265ff27f",
   "metadata": {},
   "outputs": [],
   "source": [
    "import pandas as pd\n",
    "import numpy as np\n",
    "import matplotlib.pyplot as plt\n",
    "# 读取数据集\n",
    "data = pd.read_csv('credit_data.csv')"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "54943670",
   "metadata": {},
   "outputs": [],
   "source": [
    "# 1. 数据完整性审核\n",
    "missing_values = data._________       #数据缺失值统计 2分\n",
    "duplicate_values = data._________     #数据重复值统计 2分\n",
    "# 输出结果\n",
    "print(\"缺失值统计:\")\n",
    "print(missing_values)\n",
    "print(\"重复值统计:\")\n",
    "print(duplicate_values)"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "050cab31",
   "metadata": {},
   "outputs": [],
   "source": [
    "# 2. 数据合理性审核\n",
    "data['is_age_valid'] = _________._________(18, 70)              #Age数据的合理性审核 2分\n",
    "data['is_income_valid'] = _________ > _________                 #Income数据的合理性审核 2分\n",
    "data['is_loan_amount_valid'] = _________ < (_________ * 5)      #LoanAmount数据的合理性审核 2分\n",
    "data['is_credit_score_valid'] = _________._________(300, 850)   #CreditScore数据的合理性审核 2分\n",
    "# 合理性检查结果\n",
    "validity_checks = data[['is_age_valid', 'is_income_valid', 'is_loan_amount_valid', 'is_credit_score_valid']].all(axis=1)\n",
    "data['is_valid'] = validity_checks\n",
    "# 输出结果\n",
    "print(\"数据合理性检查:\")\n",
    "print(data[['is_age_valid', 'is_income_valid', 'is_loan_amount_valid', 'is_credit_score_valid', 'is_valid']].describe())"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": null,
   "id": "04b766fd",
   "metadata": {},
   "outputs": [],
   "source": [
    "# 3. 数据清洗和异常值处理\n",
    "# 标记不合理数据\n",
    "invalid_rows = data[~data['is_valid']]\n",
    "# 删除不合理数据行\n",
    "cleaned_data = data[data['is_valid']]\n",
    "# 删除标记列\n",
    "cleaned_data = cleaned_data.drop(columns=['is_age_valid', 'is_income_valid', 'is_loan_amount_valid', 'is_credit_score_valid', 'is_valid'])\n",
    "# 保存清洗后的数据\n",
    "_________._________(_________, index=False)\n",
    "print(\"数据清洗完成，已保存为 'cleaned_credit_data.csv'\")"
   ]
  }
 ],
 "metadata": {
  "kernelspec": {
   "display_name": "Python 3",
   "language": "python",
   "name": "python3"
  },
  "language_info": {
   "name": "python",
   "version": "3.10.0"
  }
 },
 "nbformat": 4,
 "nbformat_minor": 5
}
