前置知识 · 模型策略与评估指标
进入实战前,先理解算法选择策略与分类评估体系,这些概念贯穿后续每一步。
算法选择策略:先简单后复杂 — 先用逻辑回归建立基线,再上树模型,最后调参与特征工程。
回归指标:RMSE / MAE / R²,用于连续值预测。
分类指标:Accuracy / Precision / Recall / F1。
混淆矩阵:FP(错误买入)在交易中最危险。
ROC/AUC:AUC 衡量排序能力,>0.8 良好,0.5 随机。
Step 1 · 准备数据
加载股票数据集,查看规模、特征与目标分布。数据已按日期排序,用于后续时间序列划分。
数据集概览 ·
目标分布
数据预览(前 8 行)
Step 2 · 构造标签
将目标变量转换为二分类标签(0/1),并查看正负类占比。
标签定义
Step 3 · 选择特征
剔除标识列,计算每个特征与标签的 Pearson 相关系数,按阈值筛选特征。
相关性阈值
保留 |r| ≥ 阈值 的特征,其余剔除。
-
/ 共 个
特征与目标相关性(Top-15,红负 / 蓝正)
Step 4 · 时间序列划分
按日期升序划分,避免未来信息泄露(金融量化建模关键)。
划分比例
按“日期”而非“样本”划分,前 N% 的日期进训练集。
时间序列划分强制关闭随机抽样,训练集日期严格早于测试集日期。
Step 5 · 训练模型
支持多选:可同时对比多个模型。点击卡片主体切换参数面板,点击右上角圆圈勾选/取消训练。共 7 种模型:逻辑回归 / 决策树 / 随机森林 / KNN / 朴素贝叶斯 / 线性 SVM / GBDT。
选择模型
模型关键参数
请先选择一个模型查看并调整关键参数。
Step 6 · 预测
在测试集上输出预测标签与正类概率。
预测结果预览
Step 7 · 评估
指标对比、ROC 曲线与混淆矩阵,AUC 越接近 1 越好。
多模型指标对比
| 模型 | Accuracy | Precision | Recall | F1 | AUC |
|---|
绿色高亮行为 AUC 最优模型。
ROC 曲线(多模型叠加)
混淆矩阵
对角线(绿)为预测正确;FP=错误买入,交易中最危险。
Step 8 · 特征重要性
树模型给出特征重要性,逻辑回归给出系数方向,帮助理解驱动因子。
Step 9 · 保存结果
导出预测结果、评估指标与模型参数,用于归档或复现。
导出
下列文件在本地生成,不上传服务器。