目录
正在加载目录...

McKinsey Data Science OA 面经|2026 两道编程 + 20 道选择题复盘(已过)

刚做完 McKinsey Data Science OA ,一把过。说实话做之前有点慌,题量看着不小——两道编程加 20 道选择题,第二题机器学习还拆了四个小模块。结果做下来发现,只要 pipeline 熟,其实没那么可怕。把思路和我踩的坑记一下。

顺便说下平台,我这次是 HackerRank,也有人碰到的是麦肯锡自家的 QuantHub(那种是纯选择题、不让你直接写代码)。看岗位和 office 而定,两种都准备一下心里有底。

McKinsey Data Science OA 面经|2026 两道编程 + 20 道选择题复盘(已过)

题一:日期排序

给一堆英文格式的日期字符串,排好序输出。

McKinsey Data Science OA 面经|2026 两道编程 + 20 道选择题复盘(已过)

思路很直白:先拿字典把月份缩写(Jan、Feb 这些)换成数字,再把每条日期拆成年、月、日,凑成一个元组当排序 key,最后按元组排。

我在这题上差点栽跟头——有的日期是单位数的日,比如 5 号直接写 “5” 而不是 “05”。要是你按固定位数去切字符串就会切错。我建议动手前先把所有日期扫一眼,确认你的拆分逻辑对每一行都成立,别想当然。

题二:机器学习预测(四个模块)

这题就是一整套 ML pipeline,四个模块连起来做完,正好是一个数据科学项目的缩影。

McKinsey Data Science OA 面经|2026 两道编程 + 20 道选择题复盘(已过)

第一步数据清洗,处理价格字段——里面混着带货币符号的字符串,还有一些明显离谱的数值,得先弄干净。

第二步特征工程,提时间差特征,比如 issue_reported 和 issue_responded 之间隔了多久。这种衍生出来的特征通常比原始字段更能打,值得花点心思。

第三步预处理,把缺失率特别高的列和常数列(全是一个值的那种)直接扔掉,留着只会给模型添乱;文本字段做序数编码,缺失值补上。

第四步训模型,随机森林,最后输出 submissions.csv。

随机森林在这种结构化数据上很稳,我没在调参上耗时间——把前面三步做扎实,比死磕模型收益大多了。这题模块清晰,每步都盯紧数据一致性就行。

选择题:20 道,中等难度

这部分我查了些资料也结合自己做的,麦肯锡 DS OA 的选择题基本围着这几块转,提前扫一遍不至于卡壳:

统计与概率——均值中位数众数的区别和适用场景、相关系数、回归的基本假设、各种分布(正态、二项这些)、假设检验的基本概念(p 值、一类二类错误)。

机器学习概念——监督 vs 无监督 vs 强化学习的区分、过拟合和欠拟合怎么判断、bias-variance 权衡、常见模型(随机森林、线性回归、KMeans)的特点、评价指标(precision/recall/F1、AUC)。

数据处理——pandas 常用操作(groupby、merge、缺失值处理)、哪个函数干什么(比如读 Excel 是 read_excel)、数据清洗和采样的概念。

业务逻辑——给个业务场景问你该用哪种分析方法、指标怎么设计,这类偏应用的判断题。

难度中等,不考很深的理论,把 pandas、sklearn 的常用 API 和基础统计过一遍就够。

时间分配是关键

麦肯锡这套 OA 看重的是端到端把流程走通、代码写规范,不是让你想什么巧妙算法。所以两点建议:一是提前在 Jupyter 里完整跑几遍 pipeline,从清洗到建模输出走顺,别到考场现想流程;二是编程题别在某一步卡死,第二题四个模块每个都留够时间,选择题反而好拿分,别顾此失彼。

写在最后

这次第二题模块多,但按标准流程一步步来其实挺稳的,没什么需要灵光一现的地方,考的就是熟练度和规范性。

InterviewShow 专注北美技术和数据岗的备考辅导。我们的成员来自北美一线大厂,做过 Amazon、Meta、Stripe、DoorDash 这些公司的面试,知道招聘方在每一关真正在看什么。不走流水线,每个人都配专属顾问和技术导师,从 OA 刷题规划到 VO 模拟,全程一对一跟着走。Pinterest、麦肯锡这种 DS 岗的 SQL 题池、实验设计 case、pipeline 训练我们都有覆盖。有需要的来聊聊。

END