{
  "schemaVersion": 1,
  "id": "2.1.3",
  "title": "信用评分模型数据清洗和标注流程设计",
  "durationMinutes": 20,
  "category": "数据清洗与标注",
  "scenario": "互联网金融飞速发展，使得个人金融理财变得越来越容易。而其中信用评分技术是一种对贷款申请人（信用卡申请人）做风险评估分值的统计模型，可以根据客户提供的资料、客户的历史数据、第三方平台数据（芝麻分、京东、微信等），对客户的信用进行评估。现要求根据提供的Finance数据集，选择合适的特征，开发一个申请的评分模型，对未来一段时间内借贷人出现违约的概率进行预测，对客户信用进行评估打分。提供的数据集样本数据一共15000条，10个自变量，1个因变量（SeriousDlqin2yrs）。在开发评分模型之前，首先要对数据进行数据清洗，请补全2.1.3.ipynb代码完成下面的数据预处理任务，并设计一套标注流程规范：\n\n（1）正确加载数据集，并显示前五行的数据；\n\n（2）检查数据集中的异常值并处理异常值，使用箱线图检测异常值，使用IQR方法处理异常值；\n\n设置图像的尺寸为12英寸宽和8英寸高；\n\n将画布分成3行4列，总共可以容纳12个子图；\n\n（3）检查数据集中的重复值并删除所有重复值，并记录删除的行数；\n\n（4）对数据进行归一化处理；\n\n（5）创建新的特征IncomeToDebtRatio，MonthlyIncome，并添加到数据集中；\n\n（6）将SeriousDlqin2yrs设为目标变量并标注；\n\n（7）对数据进行划分；\n\n（8）保存处理后的数据，并命名为：2.1.3_cleaned_data.csv，保存到考生文件夹；\n\n（9）制定数据清洗和特征工程规范，将答案写到答题卷文件中，答题卷文件命名为“2.1.3.docx”，保存到考生文件夹；\n\n（10）将以上代码以及运行结果，以html格式保存并命名为2.1.3.html，保存到考生文件夹，考生文件夹命名为“准考证号+身份证后6位”。",
  "skillRequirements": "（1）能够进行数据清洗和特征工程，包括缺失值处理、异常值处理、数据标准化和特征创建；\n\n（2）能够使用Python编程实现上述数据预处理和特征工程步骤。",
  "qualityIndicators": "（1）数据预处理步骤完整，方法选择合理。\n\n（2）代码实现正确，结果符合预期",
  "tasks": [
    {
      "id": "code-fill",
      "type": "code-fill",
      "title": "补全代码任务",
      "instructions": "依据公开题面和附件补全代码空位；仅检查完成度与提交格式，不公开标准内容。",
      "codeBlocks": [
        "import pandas as pd\n\n# 加载数据\ndata = __________\n\n# 显示前五行的数据\n__________\n\nimport matplotlib.pyplot as plt\nimport seaborn as sns\n\n# 设置图像尺寸\nplt.figure(figsize=(12, 8))\n\n# 识别数值列用于箱线图\nnumeric_cols = data.select_dtypes(include=['float64', 'int64']).columns\n\n# 创建箱线图\nfor i, col in enumerate(numeric_cols, 1):\n    plt.subplot(3, 4, i)\n    sns.boxplot(x=data[col])\n    plt.title(col)\n\nplt.tight_layout()\nplt.show()\n\n# 使用IQR处理异常值\nQ1 = __________(0.25)\nQ3 = __________(0.75)\nIQR = __________\n\n# 移除异常值\ndata_cleaned = data[~((data[numeric_cols] < (Q1 - 1.5 * __________)) | (data[numeric_cols] > (Q3 + 1.5 * __________))).any(axis=1)]\n\n# 检查处理重复值\nduplicates = __________()\nnum_duplicates = duplicates.sum()\ndata_cleaned = data_cleaned[~duplicates]\n\nprint(f'删除的重复行数: {num_duplicates}')\n\n#对数据进行归一化处理\nfrom sklearn.preprocessing import MinMaxScaler\n\nscaler = MinMaxScaler()\ndata_cleaned[numeric_cols] = __________\n\n# 设定目标变量\ntarget_variable = __________\n\nfrom sklearn.model_selection import train_test_split\n\n# 定义特征和目标\nX = __________(columns=[__________])   #1分\ny = __________                         #1分\n\n# 划分数据（训练集占80%）\nX_train, X_test, y_train, y_test = __________(__________, random_state=42)\n\n# 显示划分后的数据形状\nprint(f'训练数据形状: {X_train.shape}')\nprint(f'测试数据形状: {X_test.shape}')\n\n# 保存清洗后的数据到CSV\ncleaned_file_path = '2.1.3_cleaned_data.csv'\n__________(__________, index=False)\n"
      ],
      "blanks": [
        {
          "id": "blank-1",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-2",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-3",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-4",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-5",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-6",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-7",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-8",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-9",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-10",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-11",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-12",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-13",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-14",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-15",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-16",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        },
        {
          "id": "blank-17",
          "block": 1,
          "placeholder": "__________",
          "gradingMode": "completion-and-format-only"
        }
      ]
    },
    {
      "id": "2-1-response",
      "type": "rubric-response",
      "title": "清洗与标注说明",
      "instructions": "说明清洗、标注、复核及输出质量。",
      "sections": [
        {
          "id": "response",
          "label": "作答内容"
        }
      ],
      "rubric": [
        {
          "id": "criterion-1",
          "label": "缺失、重复和异常处理合理",
          "weight": 25
        },
        {
          "id": "criterion-2",
          "label": "标注规则一致且可追溯",
          "weight": 25
        },
        {
          "id": "criterion-3",
          "label": "包含抽检或质量复核机制",
          "weight": 25
        },
        {
          "id": "criterion-4",
          "label": "输出满足题面质量指标",
          "weight": 25
        }
      ]
    },
    {
      "id": "artifact-submission",
      "type": "artifact-submission",
      "title": "选择结果文件",
      "instructions": "文件仅在本机选择并校验，不上传，也不持久化文件内容。",
      "items": [
        {
          "id": "artifact-1",
          "label": "提交文件：2.1.3_cleaned_data.csv",
          "filename": "2.1.3_cleaned_data.csv",
          "extensions": [
            ".csv"
          ],
          "minCount": 1,
          "maxCount": 1,
          "maxSize": 104857600
        },
        {
          "id": "artifact-2",
          "label": "提交文件：2.1.3.docx",
          "filename": "2.1.3.docx",
          "extensions": [
            ".docx"
          ],
          "minCount": 1,
          "maxCount": 1,
          "maxSize": 104857600
        },
        {
          "id": "artifact-3",
          "label": "提交文件：2.1.3.html",
          "filename": "2.1.3.html",
          "extensions": [
            ".html"
          ],
          "minCount": 1,
          "maxCount": 1,
          "maxSize": 104857600
        }
      ]
    }
  ],
  "attachments": [
    {
      "name": "2.1.3.docx",
      "url": "assets/2.1.3/2.1.3.docx",
      "size": 14756,
      "sha256": "8eb0e850245aee60fad132a53fcd5fe8548913847a94437185adf09f4ff00c0d",
      "mime": "application/vnd.openxmlformats-officedocument.wordprocessingml.document"
    },
    {
      "name": "2.1.3.ipynb",
      "url": "assets/2.1.3/2.1.3.ipynb",
      "size": 2816,
      "sha256": "b392671419376f04b844eca4cb7b12df2b5e2c4782a926cff0ac22880c889dd0",
      "mime": "application/x-ipynb+json"
    },
    {
      "name": "2.1.3.md",
      "url": "assets/2.1.3/2.1.3.md",
      "size": 2534,
      "sha256": "2aa307f6a036e9e01969b57cff8b735b3760e92c6720d80f2e131d8796a795aa",
      "mime": "text/markdown"
    },
    {
      "name": "finance数据集.csv",
      "url": "assets/2.1.3/finance数据集.csv",
      "size": 7270450,
      "sha256": "ffa9184a8ba53082c3d06f04b70e6f5322cc67433edd03035213280ab8acee57",
      "mime": "text/csv"
    }
  ],
  "grading": {
    "mode": "completion-and-format-only"
  },
  "review": {
    "status": "approved",
    "notice": "由公开题面通用生成，未使用答案树。",
    "conflicts": []
  },
  "contentVersion": "b7c088b9226fc1bf"
}
