ML
机器学习小模型算法图鉴银行场景 · 初学者版
机 器 学 习 入 门 · 银 行 场 景 版

经典机器学习算法图鉴

第一部分:12 种最常用的「小模型」算法,每个都配一个银行案例,并讲清楚这个场景为什么选它,而不是别的算法。第二部分:FDE(前沿部署工程师)进阶——把算法交付成生产系统所需的另外 90% 知识。顶部导航栏可随时跳转。

12个经典算法
12个银行案例
3问快速选型
9个 FDE 进阶主题

怎么选:三问定范围

拿到一个业务问题,先回答这三个问题,可选算法范围立刻缩小 80%

Q1

数据有没有「标准答案」(标签)?

有 → 监督学习:拿历史答案训练模型做预测(01–08)
没有 → 无监督学习:让算法自己发现分群、结构与异常(09–12)
Q2

要预测的是数值还是类别?

连续数值(金额、估值)→ 回归问题:线性回归是起点
类别与概率(违约 / 流失 / 欺诈)→ 分类问题:逻辑回归、树模型等
Q3

更看重可解释性还是预测精度?

给监管与审计看 → 逻辑回归、决策树等白盒模型
内部排序冲精度 → XGBoost、随机森林等集成模型
经验法则:任何新任务,先用逻辑回归或决策树跑一个基线(baseline),确认数据和流程没问题,再决定要不要上更复杂的模型。
01
监督学习 · 回归

线性回归 Linear Regression

类比中介估房价:面积每多 1㎡ 加多少钱、楼龄每多一年减多少钱,加总起来就是报价。

一句话原理

找一条最贴合历史数据的直线,用各输入变量的加权求和预测一个连续数值:y = w₁x₁ + w₂x₂ + … + b。训练的过程,就是让这条线到所有点的误差总和最小。

银行场景

抵押房产估值(按揭审批)

审批住房按揭时,银行需要快速估算抵押物价值:用面积、地段、楼龄、楼层与周边近期成交价等变量拟合估值模型,输出的估值直接用于确定可贷额度(LTV,贷款价值比)。

输入面积 / 地段 / 楼龄 / 周边成交价 输出估值金额(连续数值)

为什么是它,而不是别的算法?

  • vs 分类算法:估值的目标是「一个连续金额」,天然是回归问题;逻辑回归、决策树分类输出的是类别或概率,任务类型就不匹配。
  • vs 黑盒模型:每个系数就是「单价」——每平米值多少、每年折旧多少,评估逻辑可以逐项讲给客户、审计和监管听;神经网络给不出这种账目式解释。
  • vs 复杂模型:一个片区几千条成交记录就能训练得很稳,训练成本几乎为零;数据量不大时,简单模型反而比复杂模型更不容易过拟合。

优势

  • 训练与预测极快,实现成本最低
  • 系数即业务含义,透明可审计
  • 小样本下表现稳定,是回归任务的基线

局限

  • 只能拟合线性关系
  • 对异常值(极端豪宅成交)敏感
  • 特征高度相关时系数不稳定

什么时候别用它变量与目标关系明显非线性、或变量之间交互复杂(如「地段 × 学区」的组合效应)时误差会变大,此时可换随机森林、XGBoost 等树模型。

02
监督学习 · 分类

逻辑回归 Logistic Regression

阈值 0.5
类比考试估分:先按各科成绩加权算总分,再换算成「通过考试的概率是 85%」。

一句话原理

在线性加权和的外面套一个 S 形函数(Sigmoid),把任意大小的数值压缩成 0~1 之间的概率,再按阈值(如 0.5)判定属于哪一类。

银行场景

信用卡审批评分卡

用申请人的收入、负债收入比、历史逾期次数、征信查询次数等变量,预测其未来 12 个月发生违约的概率,并把概率换算成申请评分(A 卡),高于门槛分才准入。这是全球银行信贷审批数十年的标准做法。

输入收入 / 负债比 / 逾期次数 / 征信查询 输出违约概率 → 评分卡分数

为什么是它,而不是别的算法?

  • vs 决策树 / KNN:它的输出天然是一个校准良好的概率,可以直接映射成评分卡分数与风险定价;树和 KNN 给出的「概率」往往粗糙,难以直接定价。
  • vs XGBoost:每个变量的系数方向与大小清晰可读(「多一次逾期扣 x 分」),满足监管对信贷模型可解释性的硬要求;XGBoost 虽然更准,但解释与验证成本高得多。
  • vs 神经网络:训练快、结果稳定、抗噪声,配合 WOE 分箱后是巴塞尔框架下评分卡建模的行业标准,模型验证与监控体系最成熟。

优势

  • 概率输出,可直接转评分与定价
  • 系数可解释,监管与审计友好
  • 训练快、稳定,工程与监控成熟

局限

  • 决策边界是线性的
  • 复杂非线性关系要靠特征工程弥补
  • 特征强相关时系数解释会失真

什么时候别用它特征之间存在大量复杂交互、且场景不受强可解释性约束时(如内部营销排序),XGBoost 等集成模型的精度会明显更高。

03
监督学习 · 分类 / 回归

决策树 Decision Tree

月收入达标? 有房产?
类比客户经理的审批口诀「先看收入、再看房产、最后看逾期」——决策树就是把这套口诀从数据里自动学出来。

一句话原理

像玩「二十个问题」:每一步都挑一个最能把好客户和坏客户分开的问题(如「月收入是否达标?」),逐层追问下去,最终长成一棵 if–else 规则树。

银行场景

小额消费贷自动初审

从历史审批与还款数据中学出一棵规则树,直接落地为线上审批的路由规则:满足某些条件秒批、可疑的转人工、明显不符的秒拒。规则图可以打印出来交给业务与内审逐条确认。

输入收入 / 职业 / 房产 / 逾期记录等 输出秒批 / 转人工 / 秒拒 的规则路径

为什么是它,而不是别的算法?

  • vs 所有模型:它的输出就是一张能打印上墙的规则图,业务、审计、监管一看就懂——在「规则必须能被人逐条确认」的初审场景,这是其它模型都给不了的。
  • vs 逻辑回归:数值型(收入)和类别型(职业、婚姻状况)特征通吃,不需要标准化、对缺失值不敏感,数据预处理省一大半功夫;还能自动捕捉「收入高但负债也高」这类交互关系。
  • vs 人工定规则:规则从数据里学出来而不是拍脑袋,切分点(比如收入门槛定在哪)有统计依据,且可以随数据定期重学。

优势

  • 规则完全可视化,人人看得懂
  • 免标准化、耐缺失值,预处理最省力
  • 能自动捕捉变量间的交互

局限

  • 单棵树容易过拟合、「死记硬背」
  • 换一批数据规则可能大变,不够稳定
  • 精度上限低于集成模型

什么时候别用它追求预测精度、且不要求规则逐条可读时,别停留在单棵树——它更常见的角色是随机森林和 XGBoost 的「积木」。

04
监督学习 · 集成

随机森林 Random Forest

树1 树2 树3 … 投票
类比信贷委员会:每位委员只看部分材料、各自独立判断,最后举手表决——比任何单个委员都稳。

一句话原理

随机抽样本、随机抽特征,训练几百棵各不相同的决策树;预测时全体投票表决(分类)或取平均(回归)。单棵树的偶然错误在投票中被相互抵消。

银行场景

高价值客户流失预警

用近 6 个月的资产变动、登录频率、大额转出、产品到期未续、投诉记录等上百个行为特征,提前 1~2 个月识别可能转投他行的财富客户,生成预警名单推送给客户经理挽留。

输入上百个行为与资产特征 输出流失概率 + 特征重要性排序

为什么是它,而不是别的算法?

  • vs 逻辑回归:流失的原因五花八门,上百个特征之间关系复杂、充满非线性与交互,线性模型表达力不够。
  • vs 单棵决策树:单棵树在这种高维数据上极不稳定,投票机制把随机性平均掉,泛化能力好得多;且几乎不用调参就有不错精度,是最省心的强基线。
  • vs XGBoost:对噪声和异常值更鲁棒、并行训练更快;自带的特征重要性能直接告诉业务「大额转出 + 登录骤降」是最强流失信号,方便设计挽留话术。精度要求不到极致时,它是更稳妥的选择。

优势

  • 稳健、几乎免调参,开箱即用
  • 抗噪声与异常值能力强
  • 输出特征重要性,辅助业务归因

局限

  • 模型体积大,单条预测偏慢
  • 极致精度通常略逊 XGBoost
  • 整体仍是黑盒,需解释工具辅助

什么时候别用它对推理延迟极敏感的实时场景(毫秒级授信)要谨慎;追求排序精度上限的营销场景,可再对比 XGBoost。

05
监督学习 · 集成

XGBoost Gradient Boosting / GBDT

纠错 再纠错 + + 树1 树2 学树1的错 树3 学剩下的错
类比错题本学习法:每次考完只针对错题补课,下一轮再针对新错题补,成绩逐轮逼近满分。

一句话原理

树是「串行」长出来的:先训一棵树,看它错在哪;第二棵树专门学习这些残差错误,第三棵再学剩下的错……一棵棵叠加纠错,越叠越准。

银行场景

理财产品营销响应预测

对百万级零售客户逐一打分「未来 30 天购买某理财产品的概率」,营销活动只触达得分 Top 5% 的客户。同样的短信与外呼预算下,转化率可以翻数倍,同时减少对无意向客户的打扰与投诉。

输入客户画像 / 资产 / 行为序列特征 输出购买概率 → 营销名单排序

为什么是它,而不是别的算法?

  • vs 随机森林:营销名单是排序问题,「排得准」直接等于钱——梯度提升逐轮纠错,在结构化表格数据上的排序精度(AUC)基本是天花板,多年来是业界风控与营销实战的默认首选。
  • vs 深度学习:在中等规模的表格数据上,深度模型往往打不过精心调参的 XGBoost,训练与维护成本还高得多;深度学习的主场是图像、文本等非结构化数据。
  • vs 逻辑回归:营销排序属于内部决策,不受信贷准入那样的强可解释约束,可以放心用复杂模型换精度;需要向业务解释时,可用 SHAP 对单个客户做「为什么给他打高分」的归因。

优势

  • 结构化数据上的精度天花板
  • 原生处理缺失值,内置正则化
  • 生态成熟:SHAP 解释、GPU 加速齐全

局限

  • 超参数多,需要认真调优
  • 对标签噪声比随机森林敏感
  • 天生解释性弱,监管场景需配解释工具

什么时候别用它受强可解释性监管约束的信贷准入与定价模型,优先逻辑回归评分卡;样本极少(几百条)时复杂模型也占不到便宜。

06
监督学习 · 分类

支持向量机 Support Vector Machine

类比划车位分界线:不是随便画一条,而是让线离两侧的车都尽量远,谁开车门都不剐蹭。

一句话原理

在两类样本之间找一条「隔离带最宽」的分界线——离两边最近样本(支持向量)的距离最大化;核技巧还能把直线「掰弯」,处理非线性边界。

银行场景

票据手写数字 / 印鉴识别

支票与凭证清算中,识别手写金额数字、比对预留印鉴真伪。这类任务的特征是像素与纹理级别的高维向量(上千维),而人工标注的样本往往只有几千张——SVM 在这种「小样本、高维度」组合下就能达到可用精度。

输入图像特征向量(高维) 输出数字类别 / 印鉴真伪

为什么是它,而不是别的算法?

  • vs 深度学习:深度模型要几十万张标注图才能发挥,几千张样本下容易过拟合、成本也高;小样本正是 SVM 的主场——历史上银行票据识别正是 SVM 的经典战场。
  • vs 逻辑回归 / KNN:「最大间隔」带来更强的泛化保证,小数据、高维度下往往更稳;KNN 在上千维特征里「距离」会失去意义。
  • vs 手工特征工程:核函数可以在不显式构造特征的情况下处理非线性边界,省去大量特征设计工作。

优势

  • 小样本 + 高维特征下表现强
  • 最大间隔原理,泛化能力有理论保证
  • 核技巧灵活处理非线性

局限

  • 样本几十万以上训练极慢
  • 概率输出不自然,需额外校准
  • 核函数与参数选择需要经验

什么时候别用它百万级样本的大数据场景(如全量交易反欺诈)训练成本不可接受,现已多被树模型与深度学习替代;但「小样本 + 高维」的细分任务仍是利器。

07
监督学习 · 分类

K 近邻 K-Nearest Neighbors

? K = 5:圈内 4 红 1 灰 → 判红
类比判断新邻居靠不靠谱,问问和他背景最像的几位老住户表现如何。

一句话原理

不做训练:新样本来了,就到历史库里找和它最像的 K 个「邻居」,邻居里多数属于哪一类,它就被判为哪一类。「像不像」由特征之间的距离决定。

银行场景

可疑交易人工复核辅助

反欺诈系统弹出一笔可疑交易时,自动从历史案例库中检索出金额、商户类型、时间、地点、设备等最相似的 10 笔交易,并展示它们的最终定性——「其中 8 笔曾确认为盗刷」。审核员拿到的不是一个抽象分数,而是最直接的案例参照。

输入一笔可疑交易的特征 输出最相似的 K 笔历史案例及其结论

为什么是它,而不是别的算法?

  • vs 打分模型(逻辑回归 / XGBoost):这个场景要的不是一个分数,而是「像哪些历史案例」——KNN 的输出天然就是案例清单,可以直接摆给审核员看,解释成本为零。
  • vs 需要重训的模型:没有训练环节,新确认的欺诈案例入库后立刻参与比对,不用等模型重训上线,对快速变异的欺诈手法响应最快。
  • vs 复杂系统:逻辑最简单直观,是新场景「冷启动」的第一版可用方案,跑通闭环之后再逐步演进。

优势

  • 零训练成本,新案例即刻生效
  • 输出是相似案例,解释直观
  • 实现最简单,冷启动首选

局限

  • 预测要全库检索,数据量大就慢
  • 高度依赖距离定义与特征标准化
  • 高维稀疏特征下「距离」会失效

什么时候别用它数据量大且要求毫秒级响应时,裸 KNN 撑不住——要么加向量索引(FAISS / HNSW 等)加速检索,要么改用打分模型。

08
监督学习 · 分类

朴素贝叶斯 Naive Bayes

中奖通知 点击链接 账户冻结 诈骗 92% 正常 8%
类比医生看症状猜病:发烧、咳嗽、乏力各自提示流感的概率相乘,得出综合判断。

一句话原理

用贝叶斯公式「反推」:出现「中奖、点击链接、账户冻结」这些词时,这条短信是诈骗的概率有多大?为了算得快,「朴素」地假设各个特征相互独立、各算各的再相乘。

银行场景

钓鱼短信拦截 · 客服工单分类

一是拦截仿冒银行的钓鱼短信与邮件,在到达客户手机之前实时识别;二是把客服工单按内容自动分类(账户类 / 贷款类 / 投诉类),路由到对应的坐席队列,缩短响应时间。

输入短信 / 工单文本分词后的词袋 输出诈骗概率 / 工单类别

为什么是它,而不是别的算法?

  • vs 深度 NLP / 大模型:钓鱼短信的判别主要靠关键词组合,朴素贝叶斯毫秒级出结果、成本便宜几个数量级,可以直接嵌进短信网关做实时拦截——这类任务用大模型是高射炮打蚊子。
  • vs 逻辑回归:文本分词后是几万维的稀疏「词袋」特征,朴素贝叶斯天然适配这种表示,几千条标注样本就能上线,是文本分类数十年的经典快速基线。
  • 增量更新容易:骗子换了新话术,更新一下词频统计就能跟上,不需要完整重训模型。

优势

  • 训练与预测毫秒级,可实时拦截
  • 小样本可用,上线门槛极低
  • 新词新话术增量更新容易

局限

  • 「特征独立」假设在复杂语义下失真
  • 不理解上下文、语序与反讽
  • 相关特征会被重复计分

什么时候别用它需要真正理解语义的任务——比如投诉文本的情绪与诉求分析——应升级到深度模型或大语言模型。

09
无监督 · 聚类

K-means 聚类 K-means Clustering

× 为各群中心(平均画像)
类比整理衣柜:不用别人定规则,把相似的衣物自然归成几堆,每堆再起个名字。

一句话原理

不给任何标签,只指定分成 K 群:算法反复执行「每个点认领最近的群中心 → 群中心移动到本群平均位置」,直到分群稳定。同群内彼此相似、不同群差异明显。

银行场景

零售客户分群经营

用 AUM、交易频率、产品持有数、渠道偏好、年龄等给百万级零售客户分群,得到「高净值稳健型」「年轻高频数字型」「沉睡低效型」等客群画像,分别配置差异化的权益、产品与触达策略。

输入AUM / 交易频率 / 产品持有 / 渠道偏好 输出K 个客群及其中心画像

为什么是它,而不是别的算法?

  • vs 监督学习:客户分群没有「正确答案」标签——没人预先知道应该分成哪几类——监督学习完全用不上,这正是聚类的用武之地。
  • vs 层次聚类等方法:算法简单、可扩展性强,百万级客户几分钟出结果;层次聚类在这种数据量下计算成本高得多。
  • 业务可用性:每个群中心就是该群的「平均画像」(平均 AUM、平均交易频率……),业务同事拿来就能给客群起名字、配策略,沟通成本最低。

优势

  • 简单快速,百万级客户可扩展
  • 群中心即画像,结果好讲好用
  • 无需任何标签

局限

  • K 要人工指定(肘部法则辅助)
  • 偏好球形客群,对量纲敏感
  • 对离群点敏感,需先处理极端值

什么时候别用它客群形状不规则或大小极不均衡时效果差,可试 DBSCAN、高斯混合模型;聚类之前务必对特征做标准化。

10
无监督 · 降维

主成分分析 Principal Component Analysis

主成分 1 主成分 2
类比把 50 项体检指标浓缩成「代谢健康分、心血管风险分」两三个综合分——信息大头都保留了。

一句话原理

把几十上百个高度相关的指标「旋转压缩」成少数几个互不重叠的综合因子,按信息量(方差)从大到小排序,只保留最重要的前几个方向。

银行场景

对公信贷财务指标降维

企业财报能衍生出上百个财务比率,而且彼此高度相关(各种利润率之间、各种周转率之间)。先用 PCA 压缩成十几个互不相关的主成分,再喂给违约预测模型,消除多重共线性、模型更稳。同样的思路也用于把整条利率曲线压缩成「水平 / 斜率 / 曲率」三个因子做市场风险管理。

输入上百个财务比率 输出十几个互不相关的主成分

为什么是它,而不是别的算法?

  • vs 直接建模:把上百个高度相关的指标直接塞进逻辑回归,会引发多重共线性、系数上蹿下跳;PCA 先把它们压成互不相关的主成分,下游模型立刻稳定。
  • vs 手工删变量:逐个筛变量既费时又丢信息;PCA 按信息量自动压缩,同样维数下保留的信息最多。
  • 无监督标配:不需要标签,任何建模之前都能做,属于「预处理标配」;还能把数据压到 2 维做可视化、顺带去噪。

优势

  • 消除多重共线性,稳定下游模型
  • 按信息量压缩,去噪与可视化两用
  • 无需标签,建模前处理标配

局限

  • 主成分是原指标的混合,含义要人工解读
  • 只捕捉线性相关关系
  • 量纲不同时必须先标准化

什么时候别用它监管要求「每个入模变量都有清晰业务含义」的评分卡场景慎用——主成分很难命名;数据结构明显非线性时可考虑其它降维方法。

11
无监督 · 异常检测

孤立森林 Isolation Forest

2 刀即被隔离 → 异常 人堆里的点要切很多刀
类比操场上随手画线分区:远离人群的落单者,几条线就被单独圈出来了。

一句话原理

随机选特征、随机切一刀,反复切分:正常点挤在「人堆」里,要切很多刀才能被单独隔离;异常点「孤僻」,几刀就被切出来——被隔离得越快,异常分越高。

银行场景

交易反欺诈 / 反洗钱异常初筛

对海量转账交易(金额、时间、频次、对手方集中度、设备与 IP 等特征)无监督地打异常分,把得分最高的 0.1% 推送给风控团队人工调查——能捕捉到从未见过、规则库里还没有的新型作案模式。

输入交易行为特征 输出0~1 异常分(越高越可疑)

为什么是它,而不是别的算法?

  • vs 监督模型:欺诈与洗钱的标签极少、确认滞后,而且黑产手法不断变异——监督模型只认得「见过的老套路」;孤立森林不需要标签,能发现全新模式。
  • vs LOF 等密度方法:它为异常检测原生设计,线性时间复杂度、内存占用低,扛得住每天千万级交易;基于距离 / 密度的方法在这种数据量和维度下慢得多。
  • 运营友好:输出的是连续异常分,可以按人工调查团队的人力预算灵活划定推送阈值,而不是硬性的是 / 否。

优势

  • 无需标签,能抓新型作案手法
  • 线性复杂度,海量交易扛得住
  • 异常分连续,阈值随人力灵活调

局限

  • 异常 ≠ 欺诈,误报要人工消化
  • 局部密度型异常不如 LOF 敏感
  • 结果解释需结合业务规则

什么时候别用它当欺诈标签充足且新鲜时,监督模型精度更高;实践中常见的是「无监督初筛 + 监督精排 + 专家规则」的组合打法,而不是单打独斗。

12
无监督 · 关联规则

关联规则 Apriori / Association Rules

提升度 ×3 工资代发 + 手机银行 信用卡 支持度 · 置信度 · 提升度 三把尺子
类比超市发现「买尿布的常顺手买啤酒」,于是把两者摆在一起——经典的购物篮分析。

一句话原理

从海量「购物篮」(客户的产品持有组合)中数出频繁一起出现的组合,产出「办了 A 的人往往也办 B」这类规则,并用支持度、置信度、提升度三把尺子衡量规则是否可信。

银行场景

零售产品交叉销售规则挖掘

从全行客户的产品持有数据中挖出规则,例如「开通工资代发 + 手机银行的客户,6 个月内办信用卡的比例是普通客户的 3 倍」,据此在手机银行 App 对该人群定向展示办卡入口,提升交叉销售件均产能。

输入客户产品持有组合 / 交易篮 输出「A → B(提升度 ×3)」规则集

为什么是它,而不是别的算法?

  • vs 黑盒推荐模型:产出的是「如果…那么…(提升度 3 倍)」的白盒规则,市场部能直接读懂、合规能逐条审核——在银行这种强合规环境里落地阻力最小。
  • vs 监督学习:不需要任何标签,直接吃现成的产品持有与交易流水就能挖掘,启动成本几乎为零。
  • 策略沉淀:规则可以固化为长期营销策略(渠道定向推荐位、话术清单),比一个不断漂移的模型分数更好沟通、更好维护。

优势

  • 白盒规则,业务与合规都能读
  • 无需标注数据,启动成本低
  • 规则可沉淀为长期策略资产

局限

  • 相关不等于因果
  • 组合爆炸,需设支持度门槛
  • 对低频长尾产品不敏感

什么时候别用它要做「千人千面」的个性化排序时,规则的粒度太粗,应升级到推荐模型;数据量极大时可改用 FP-Growth 等更快的算法。

选型速查表

12 个算法 × 任务类型 × 银行场景 × 优势与局限,一张表放在手边

算法任务类型典型银行场景一句话优势主要局限
01线性回归回归抵押房产估值系数即「单价」,透明可讲只能拟合线性关系
02逻辑回归分类信用卡审批评分卡概率输出,监管友好决策边界是线性的
03决策树分类 / 回归消费贷自动初审规则规则直观、可打印上墙易过拟合、不够稳定
04随机森林集成高价值客户流失预警稳健、几乎免调参体积大、单条预测偏慢
05XGBoost集成理财营销响应排序表格数据精度天花板调参与解释成本高
06支持向量机分类票据手写数字识别小样本高维下表现强大样本训练极慢
07K 近邻分类相似欺诈案例参照零训练、案例可解释预测慢、需建索引
08朴素贝叶斯分类钓鱼短信拦截毫秒级、成本极低特征独立假设失真
09K-means聚类零售客户分群快速产出客群画像需定 K、需标准化
10主成分分析降维财务指标压缩去共线性、保留信息主成分需人工解读
11孤立森林异常检测反欺诈异常初筛无标签也能抓新手法异常不等于欺诈
12关联规则关联挖掘产品交叉销售白盒规则直接落地相关不等于因果

经验法则:先跑逻辑回归 / 决策树当基线;结构化数据认树模型;监管场景可解释性优先;结构化预测交给小模型,语义理解交给大模型。

第 二 部 分

FDE 进阶:让算法在银行真正跑起来

FDE(Forward Deployed Engineer,前沿部署工程师)源自 Palantir,如今是各 AI 公司把能力落进客户业务的核心岗位。懂算法只是起点——以下 9 个主题,是把模型交付成合规、稳定、有人用的生产系统所需的另外 90%。

F1
FDE 进阶 · 角色

FDE 是什么 Forward Deployed Engineer

一句话定义

驻扎在业务现场的全栈工程师:把通用 AI 能力翻译成业务里真正跑起来的系统,并对最终价值负责。数据科学家的产出是模型,ML 平台工程师的产出是工具,架构师的产出是方案书——FDE 的产出是「跑起来的价值」。

技术广度

数据、特征、模型、部署、监控都要能上手。不求每一层最深,但求全链路打通:能自己把 PoC 从取数写到上线。

业务翻译

把「流失太多」「审批太慢」这类业务语言,转成可建模、可验收的问题定义——这是 FDE 与纯工程角色最大的分野。

交付推动

跨风险、科技、业务、合规多方协调资源,把系统推到「真正有人用、持续产生价值」,而不是停在演示环节。

与相邻角色的区别

  • 数据科学家:钻研模型与精度,交付物是模型本身;FDE 借用他们的产出,但对「上线之后有没有用」负责。
  • ML 平台工程师:建训练与部署平台,交付物是工具与基础设施;FDE 是这些工具最重度的使用者。
  • 解决方案架构师:偏售前,交付物是方案书;FDE 偏交付与驻场运营,把方案书变成运行中的系统。

常见误解FDE 不是「什么都会一点的打杂」,而是对最终业务价值负责的端到端 Owner——权责边界要在项目章程里写清楚。

F2
FDE 进阶 · 流程

ML 项目全流程 建模只占一成

全景图

一个 ML 项目的完整生命周期有七站。行业共识是:数据相关工作占掉 60–80% 的时间,真正「建模调参」只占 10% 左右——所以 FDE 的功夫大半在模型之外。

1业务理解 2数据准备 3特征工程 4建模调优 5评估验证 6部署上线 7监控迭代

以「信用卡评分卡」走一遍:FDE 在每一步的关键动作

  • ① 立项:与风险部书面对齐标签口径——违约 = 放款后 12 个月内出现逾期 90 天以上;同时写清验收指标与数据段。
  • ② 数据:预留最近 6 个月样本做时间外验证(OOT),杜绝「考试泄题」;核对多系统字段口径。
  • ③ 建模:逻辑回归打底出基线,XGBoost 做挑战者对照——先有基线,再谈提升。
  • ④ 上线:影子运行 4 周:只打分、不生效,比对线上 / 线下分数一致性后再切流。
  • ⑤ 运营:月度 PSI 监控 + KS 回溯,KS 相对下降 20% 即触发重训评审。

留意项目失败极少因为算法不够新,多半死在口径、数据与运营这三站。

F3
FDE 进阶 · 数据

数据三大坑 模型翻车的头号原因

为什么先讲坑

被这三个坑毁掉的项目,远多于被「算法选错」毁掉的。FDE 进场后的第一轮尽调,基本都是围着它们转。

① 标签定义含糊

「违约」是逾期 30 天还是 90 天?表现期是 6 个月还是 12 个月?口径不清,模型再准也答非所问。

怎么防开工前拿到业务书面确认的标签口径;用 vintage 分析确定合理的表现期。

② 数据泄漏

把「事后才有」的信息喂给模型:用催收记录预测违约(催收发生在违约之后),离线 KS 高得惊人,上线即翻车。

怎么防每个特征都问一句「预测时点拿得到吗」;坚持时间外(OOT)验证。

③ 样本不平衡

欺诈仅占 0.1% 时,「全判正常」的模型准确率高达 99.9%,却一个欺诈都没抓到。

怎么防类别权重 / 重采样处理;评估指标改用 KS、PR-AUC,弃用准确率。

共同解法先怀疑数据,再怀疑模型;离线指标好得不真实时,第一反应是查泄漏。

F4
FDE 进阶 · 特征

特征工程 银行的常用套路

一句话原则

特征质量的上限,就是模型效果的上限。银行场景 80% 的有效特征,来自下面四个套路。

时间窗聚合(RFM 思路)

近 1 / 3 / 6 / 12 个月 × 次数、金额、均值、趋势、占比的交叉组合——例如「近 3 个月大额转出次数」「近 6 个月 AUM 变化率」。银行八成特征由此而来。

WOE / IV(评分卡标配)

连续变量分箱后按「好坏比」编码为证据权重(WOE),单调、稳健、可解释;用信息值(IV)筛变量:< 0.02 弃用,0.1–0.5 优选,> 0.5 先查是否泄漏。

类别、缺失与标准化

类别变量做独热或目标编码;缺失本身可能就是信号(可单列「是否缺失」特征);KNN、K-means、SVM 等距离类算法输入前必须标准化。

口径对齐与特征字典

同一个「月收入」在核心系统、信贷系统、报表口径里可能是三个数。FDE 落地第一课:建特征字典,写清每个特征的来源、口径与更新频率。

造特征时刻自问这个信息在「预测发生的那一刻」,系统里真的拿得到吗?

F5
FDE 进阶 · 评估

模型评估 银行的尺子

一句话原则

不同任务用不同的尺子:风控看 KS,营销看 Lift,稳定性看 PSI;在不平衡数据上,准确率几乎没有意义。

KS ≥ 0.3风控模型通用语言好坏样本区分度;0.3 可用,> 0.4 良好,> 0.75 反而要怀疑泄漏
AUC ≥ 0.75排序能力0.5 等于瞎猜;对不平衡样本可换看 PR-AUC
Lift 3×营销名单质量Top 10% 名单的响应率是随机名单的几倍
PSI < 0.1稳定性监控0.1–0.25 需关注,> 0.25 预警并评估重训

把指标翻译给业务听

  • 精确率 vs 召回率:精确率 = 抓到的里有多少是真的(别扰民);召回率 = 真的里抓到了多少(别漏网)。反欺诈重召回,营销重精确。
  • 阈值不是 0.5:误拒一个好客户 ≈ 损失 500 元利息利润,漏放一个坏客户 ≈ 损失 8,000 元本金——两边代价差 16 倍,阈值就该往「宁严勿松」偏。和业务一起填成本矩阵,选期望损失最小的切分点。
  • 汇报语言:把 AUC 翻译成「通过率 – 坏账率」曲线,管理层才听得懂、才好拍板。

提醒指标是给模型看的,通过率和坏账率才是给业务听的;别把 0.5 当成理所当然的阈值。

F6
FDE 进阶 · 合规

可解释性与模型合规 Explainability & MRM

一句话原则

在信贷等监管场景,可解释性不是加分项,而是准入门槛:模型再准,讲不清楚就上不了线。

可解释性工具箱

SHAP 全局:特征重要性排序,供模型验证与业务审阅。

SHAP 局部:单客户归因——回答「这个客户为什么被拒」。

拒绝原因码:把归因翻译成向客户告知的规范语句。

方向校验:收入越高违约越低?方向反了先查数据再上线。

模型合规要点(银行)

三道防线:业务建模 / 独立验证 / 内部审计,全程留痕备案。

全生命周期:开发文档、上线审批、定期回溯、退出机制,监管对互联网贷款等模型已有明确要求。

自动化决策:个人信息保护法赋予客户「要求说明、拒绝纯自动化决策」的权利。

公平性:性别、民族等变量禁用,并警惕邮编、机型等「代理变量」。

FDE 动作清单

  • 上线前跑一遍 SHAP 方向校验,把与业务直觉相反的特征逐个说清楚或剔除。
  • 提前套用模型验证团队的文档模板开发,避免验收阶段返工。
  • 把拒绝原因码当成产品需求写进排期,而不是上线后补丁。

提醒公平性审查别只看「有没有直接用敏感变量」——高度相关的代理变量同样会被追责。

F7
FDE 进阶 · MLOps

部署与监控 MLOps 的银行打法

一句话原则

部署形态选对,成本省一半;上线节奏走「影子 → 冠军挑战者 → 灰度」三步,是银行久经考验的标准打法。

批量跑批

T+1 生成营销名单、贷后预警清单。成本最低、容错最大,绝大多数场景的第一选择。

实时 API

毫秒级反欺诈、秒级线上授信。要做压测、超时降级预案与兜底规则。

决策引擎内嵌

评分卡转成规则表进决策引擎,与策略规则同平台管理、同流程审批。

1影子运行 · 只打分不生效,核对线上线下一致性 2冠军 / 挑战者 · 新旧模型分流对比 3灰度放量 · 5% → 20% → 100%,随时可回滚

监控三件套 + 退出机制

  • 数据漂移:输入特征与分数分布的 PSI / CSI,月度例行。
  • 性能回溯:等标签成熟后回算 KS、AUC,确认模型没有「悄悄变笨」。
  • 业务指标:通过率、坏账率、投诉量周度盯盘——模型问题往往先在业务指标上冒头。
  • 退出机制:重训触发条件与回滚预案在上线文档里写清楚,出事时不用临时开会。

提醒上线不是终点:没有监控的模型,等于没有上线。

F8
FDE 进阶 · 沟通

与业务对话 需求转译五步

一句话原则

FDE 一半的价值在「翻译」:把一句「流失太多」翻成一个可建模、可验收的问题。翻译质量决定项目一半的成败。

1业务痛点 2量化 KPI 3ML 任务 4标签与数据 5成功标准
示例走查

「高价值客户流失太多」的五步翻译

「流失太多」→ 高价值客户季度流失率从 8% 降到 5% → 二分类:预测未来 60 天流失概率 → 流失 = AUM 降幅 > 80%,数据在 CRM + 核心系统 → 验收:OOT KS ≥ 0.3,且试点分行挽留率提升 ≥ 20%。

期望管理与项目节奏

  • 基线先行:先给基线与效果区间,不承诺精度数字;用第一版基线锚定各方预期。
  • 三级节奏:PoC(4–6 周)→ 试点(1 家分行 / 1 个渠道)→ 全面推广,每级都有明确的 Go / No-Go 标准。
  • 验收落纸面:用哪段数据、看哪个指标、谁签字,提前写清,避免「感觉不准」式扯皮。
  • ROI 说话:汇报用钱说话——转化提升 × 件均收益 − 成本,比 AUC 有说服力得多。

三种常见死法标签没定义清楚就开工;用离线指标验收在线效果;上线之后没人管监控。

F9
FDE 进阶 · 架构

小模型 × 大模型 FDE 的架构决策

客户请求 大模型 · 理解意图 / 组织回复 朴素贝叶斯 工单路由 XGBoost 推荐打分 孤立森林 风险核查 调用结果由大模型汇总后回复客户
类比大模型是前台经理,小模型是各科室专家——经理听懂需求,把活派给对的专家,再汇总答复。

分工原则

结构化预测、打分、排序 → 小模型:便宜、快、可解释;语义理解、内容生成、多轮交互 → 大模型。单次推理成本相差 3–6 个数量级,高频调用场景里成本是硬约束。

Agent 时代的新任务

小模型成为智能体的「工具」

在智能体(Agent)架构里,本图鉴第一部分的 12 个算法都可以封装成被大模型调用的工具。FDE 的新工作:把它们做成稳定、可监控的服务接口,并在关键决策处设计好人在环上(Human-in-the-loop)的审批节点。

架构决策清单

  • 先算成本账:高频调用(如每笔交易、每条短信)优先小模型;把大模型留给低频高价值的语义任务。
  • 可解释性留给小模型:需要向监管或客户说明的决策点,用评分卡、树模型或规则,别用生成式模型拍板。
  • 接口化与监控:小模型服务化后同样要有 PSI、时延、错误率监控——它们现在是 Agent 链路上的关键节点。
  • 人机协同:高风险动作(大额审批、账户处置)设置人工审批点,让模型提建议、让人做决定。

两个别别用大模型做本该小模型做的打分——贵、慢、还不稳定;也别指望小模型去「理解」自然语言。