目录
正在加载目录...

NVIDIA MLE 面经|26NG 五轮拷打全记录

很多人以为 MLE 面试主要考模型和调参,面完 NVIDIA 之后最大的感受是:这家更关注底层原理、系统能力和性能优化。Recruiter 在开场沟通时就把话挑明了——他们要看的是候选人有没有高效编程和定位性能问题的能力。五轮走完,把每轮的题目和考点完整记下来。

NVIDIA MLE 面经|26NG 五轮拷打全记录

NVIDIA MLE 流程概览

NVIDIA 的 NG 招聘是按 New College Graduate 项目 分方向招的,可以详细看下。

整个流程 4-5 轮,不同团队侧重点有差异,但 ML 基础、GPU 相关知识和工程落地能力贯穿始终。我的五轮构成:Coding + ML 基础 → CUDA 与 GPU 性能 → ML System Design → Deep Learning Optimization → Behavioral。

第一轮:Coding + ML Fundamentals

开场就不按常理出牌——不是常规算法题,而是要求用 NumPy 手写 Multi-Head Attention 的 forward process。QKV 投影、按头拆分、scaled dot-product、softmax、拼接输出,每一步的矩阵维度变换都要清清楚楚,写的过程面试官会随时问某一步的 shape 是多少、为什么要除以根号 d_k。

ML 基础问答围绕这几块:L1 与 L2 正则化的区别、Dropout 的作用机制、Batch Normalization 在训练和推理阶段的区别。都是经典八股,但追问会到原理层——比如 BN 推理时用的 running statistics 是怎么维护的,答”背过的结论”不够,要能推。

第二轮:CUDA 与 GPU Performance

NVIDIA 的特色环节,别家基本不考。

面试官给一个性能较差的 CUDA kernel,让你逐步优化。考点是那些经典的性能杀手:memory coalescing 没做好、shared memory 没用上、bank conflict、warp divergence、occupancy 不足。优化不是一步到位,而是你说一步、他问为什么、改完再看还有什么可挤的。

有些团队还会结合 profiling 工具,让你分析 kernel stall 的原因——给你 Nsight 的输出,问瓶颈在访存还是计算、stall 的主要来源是什么。没有实际写过和调过 CUDA 的人,这轮基本裸奔。另外这轮偶尔会穿插双蛋问题、称球这类逻辑题,对 problem solving 的要求很高,节奏也快。

第三轮:ML System Design

系统设计偏真实生产环境,我的题目是:设计一个服务千万级用户的推荐模型推理平台

主体设计讲完(模型服务化、动态 batching、多级缓存、GPU 集群调度),后面跟着一串运维场景题:模型热更新怎么避免服务中断?GPU utilization 突然下降怎么排查?推理链路的性能瓶颈怎么定位?

这部分考的是真实的工程经验和排障思路——热更新讲双 buffer 或影子部署、灰度切流;utilization 下降从数据供给、batch 凑批、CPU 预处理瓶颈、显存碎片这些方向逐层排;链路瓶颈用 profiling 分段计时定位。没碰过线上推理服务的话,建议提前把 Triton Inference Server 的文档过一遍,很多设计点直接对得上。

第四轮:Deep Learning Optimization

这轮围绕简历项目展开。我的项目涉及分布式训练,面试官顺着往下挖:数据并行和模型并行怎么选、通信开销怎么压、混合精度训练里 loss scaling 为什么需要、梯度累积对吞吐的影响。

讨论重点不只是算法本身,还包括训练效率、硬件资源利用率和实际吞吐表现——他们想听到具体数字:你的 GPU 利用率是多少、优化前后吞吐提升了几倍、瓶颈是怎么定位的。简历上写了分布式或混合精度的,这些数据一定提前备好,说不出数字等于白写。

技术栈上建议把 PyTorch 的高级特性过一遍,GEMM 加速、内存架构这些底层逻辑他们不仅看你会不会用,更看你懂不懂为什么快。

第五轮:Behavioral + Team Fit

最后一轮由 Engineering Manager 或团队负责人来面。相比传统 BQ,更关注真实工程环境里的协作能力:跨团队怎么推进、和别人技术分歧怎么处理、线上事故怎么复盘。

多轮面谈全程都会抠简历项目的细节,BQ 建议提前调研 NVIDIA 的文化和价值观,用 STAR 法则组织故事。这家非常看重 culture fit,技术再好价值观不契合也白搭。

FAQ

Q:不会 CUDA 能过 NVIDIA MLE 吗?

看团队。有些偏算法的组会把 CUDA 轮换成更多的 ML system 内容,但 GPU 架构的基本理解(内存层级、warp、为什么 GEMM 快)是所有组的底线。JD 里写了 CUDA 的组,这轮必考,绕不开。

Q:手写 attention 允许用 PyTorch 吗?

我这场明确要求 NumPy,意图很明显——不让 autograd 和现成模块帮你藏细节。矩阵维度、mask 的位置、softmax 沿哪个轴,全要自己对。练的时候直接按 NumPy 练。

Q:逻辑题(双蛋、称球)出现概率高吗?

不是每轮必有,但确实有团队穿插着考,主要看 problem solving 的现场反应。经典的十来道过一遍思路即可,不值得投入太多时间。

Q:BQ 权重高吗,会不会像亚麻那样按条打分?

没有亚麻 LP 那种明确的打分框架,但 culture fit 的一票否决是真实存在的,尤其 EM 轮。提前调研下 NVIDIA 的文化关键词,故事往协作和 ownership 上靠。

Q:五轮周期多长,压力大吗?

我的情况是两周内排完五轮,节奏偏快。强度上第二、四轮最耗神,都是被连环追问的轮次,中间留出消化和复盘的时间很重要。

写在最后

NVIDIA 的 MLE 面试说到底就是在确认一件事:你懂不懂模型底下那一层。GPU 架构、CUDA、分布式、性能调优、排障,这五样都得拿得出手,才是他们要的 MLE。光懂模型,只能算刚够格进门。

我的 CUDA 那轮能稳住,很大程度靠面前在 InterviewShow 做的两次 mock——他们 MLE 专题里的 kernel 优化题和真场的挤牙膏式追问几乎一个模子,被虐过两次之后真场反而没那么慌了。北美 MLE 这条线他们覆盖得比较全,VO,OA辅助都有。

END