面经流水账
记录一下自己的一些面经,纯流水账
2026-04-14
阿里C端事业部,Agent方向
- 自我介绍
- 纯聊项目,问了几个项目上的问题,确实感觉自己之前的实习和项目都太水了
- 反问,介绍说不是希望招Agent开发,这时候就觉得没戏了,说是要做Agent自进化,能够组合小模型和Agent能力,自我编排进化,类似于subagent这些好像。
结果:一面结束秒挂。
2026-06-10
得物社区?算法方向
- 自我介绍,我的自我介绍好像有点短
- 聊项目,数据如何获取,动机,但是我感觉似乎很多技术上细节没问什么。如何约束Agent?除了人为干预有什么更加好的方式?做项目的时候,vibe coding的比例如何?
- leetcode:编辑距离,忘了,尬在那了。不过也是第一次熟悉了线上编码
- 反问,主要业务是为了通过大模型干什么?感觉主要是进行内容审核,与后训练其实关系我觉得并不大,就是所有事情塞给大模型去做。对我的项目如何看待?觉得还是做点科研导向或者业务导向的项目比较好?第二个项目有点玩具,是否真的有这些需求?
- 面完吃饭发现上午投的之江实验室点击寄送了,有点懵圈。
- 2026-06-15电话通知offer
2026-06-11
tiktok内容理解大模型算法方向
- 自我介绍
- 聊最满意的一个项目,结合项目问八股,强化学习一些技术,有没有比较过不同基座模型的效果?有没有遇到过过拟合的问题?为什么单纯微调Attention层可能效果更好?是否实际部署过?这个项目觉得最大的收获是什么?
- 手撕代码,第K大个数,中午刚看过,讲思路我说用堆,他跟我说也可以考虑快排的思想,堆怎么使用忘了,看了看提示文档,调整堆顶元素犯蠢了,调了很久。
- 反问,后训练在业务中做什么?可能主要是一些内容创作的助手,偏推荐更多一些,生成式推荐。对于我项目的意见?聚焦于深度,引导别人去进行询问,针对一份开卷考试的简历多思考提问。业务算法并不是很看重科研和论文,还是要提升代码能力多刷刷题,尤其是字节这种公司。
- 2026-06-15通知二面
2026-06-16
初创公司,建筑类的业务
- 介绍业务
- 自我介绍
- 聊项目,聊实习,八股介绍DPO,没有对于一系列操作后的模型评价效果吗?不是前后的效果,而是是否可用的评价?这里傻了,其实是通过大模型进行一个判断的,都不可用就算平局。
- 手撕代码,两数之和,乐
- 反问,似乎算法没有多少,更多是进行平台的搭建工作。
liblib.ai
- 十分钟结束,似乎对我也没什么兴趣
- 主要做生图业务,我说可能对于生图那些扩散模型不是很了解,也就聊了聊业务,项目甚至都没怎么谈
- 很失败的一次面试感觉,以后还是得投确实match的岗位,不难很难受
- 算了,面试一天乐,躺会
2026-06-17
字节tiktok二面:
- 自我介绍
- 拷打,问的很多都是业务结合,数据清洗怎么做的?你觉得有什么办法能够加快提升模型训练的效果或者你有什么经验遇到什么问题?一般不会丢失数据?几十亿的数据不可能去那样处理,数据的数量,数据的质量?(消偏、做一些规则化校验)差的数据也要保留?可能也能够从中学习到一些知识。如何解决模型的遗忘问题?我东扯西扯,没想过这个问题,很烂,后来聊lora跟我提了一嘴lora就是个方法。对于预训练、SFT、强化学习的看法是什么样的?每个阶段如何能够不造成上一阶段的遗忘?强化学习你知道都有哪些改进?答了PPO到GRPO到GSPO/DAPO。全量微调和Lora微调的区别?你对于agent的理解?
- 手撕代码,删除有序链表中重复元素,我只能说我自己糖丸了,我也不知道问题出在哪里,最后说一下思路
- 反问,几十亿数据一般怎么做?规则化的校验,消偏
- 2026-06-18睡醒看到感谢信
解决模型训练中的“灾难性遗忘”,核心思路是在学习新知识时,保护旧知识对应的模型参数。最常用且有效的策略如下:
- 数据回放(最简单有效):在训练新数据时,按比例(如 5%~10%)混入旧数据或通用预训练数据,让模型不断“复习”。
- 参数高效微调(如 LoRA):针对大模型,冻结预训练的主权重,只训练极少量的附加参数,从物理上隔离新旧知识。
- 知识蒸馏:在训练新任务时,增加一个损失项,强迫新模型的输出尽量与旧模型(Teacher)保持一致。
- 限制重要参数(如 EWC):找出对旧任务重要的参数,在更新时限制它们的修改幅度,只让“不重要”的参数去适应新任务。
💡 极简实操指南:
- 大模型微调:直接用 LoRA + 混入少量通用数据。
- 允许保存旧数据:优先使用 数据回放。
- 严禁保存旧数据:使用 知识蒸馏 或 EWC。
- 第一步排查:先调小学习率,很多时候遗忘只是因为学习率太大,旧参数被暴力覆盖了。
好的,根据我们之前的讨论,我将核心结论提炼为以下几个要点,便于您快速查阅和记忆。
核心策略转变
- 从“数据清理”转向“数据治理”。核心是将每条业务数据(不分好坏)都视为可挖掘的资源,而非简单的过滤对象。
处理低质量数据
- 改写净化:使用大模型对低质数据进行重写,修正错误、优化表达,保留其核心业务信息。
- 动态权重:训练时根据数据质量动态调整其贡献度,质量越低,影响越小。
- 选择性过滤:仅丢弃样本中无信息量的部分,而非整个样本。
- 资源化利用:将低质数据作为种子,生成更多高质量的合成数据来扩充训练集。
数据脱敏处理
- 核心原则:绝不让模型学习输出占位符或特殊符号。
- 伪匿名化:用虚构的同类型实体替换真实实体(如“张小明”变“李大同”),保证训练语境自然。
- 两阶段策略:训练时构建虚拟世界,推理时由工程层负责将虚拟实体映射回真实信息。
- 隐私增强:对金融、医疗等强监管场景,可引入差分隐私(添加噪声)等技术。
选择建议
- 一般业务场景,优先从数据预处理(如静态脱敏) 入手,性价比最高。
- 强监管行业,则需采用差分隐私、联邦学习等更强大的技术组合。
2026-06-18
京东变色龙事业部AI算法:
- 纯闲聊15分钟,当场约hr面
- 最丝滑的一集
2026-06-22
B站大模型算法
- 自我介绍
- 聊项目,如何判断数据好坏,为什么做DPO,穿插八股,GRPO、PPO,损失函数是什么,有情景题,问如何训练一个直播违规校验的模型?数据获取、准备,何时介入人工审核,提示词的设计,打标全是数字如何获取训练数据?什么时候做DPO或者GRPO,什么场景需要,了解一下最新的OPD,日常用claude code做什么,skills有没有自己写过
- 手撕代码,峰值数字,理解错题目意思了,不过题目本身就是错的,后来推导一下思路,没让写
- 八股,问点transformer相关,注意力,位置编码,梯度裁剪
- 反问,模型训练规模,大概9B左右,多模态、ASR识别为主,做直播内容识别,底线违规,推流鼓励
-
结束后约二面
-
问题一:DPO与GRPO适用场景及何时只做SFT
- DPO适用场景:主要用于对齐人类主观偏好(如文风、安全性、价值观),适用于拥有成对偏好数据且评判标准难以用代码量化的任务。
- GRPO适用场景:主要用于提升客观逻辑推理(如数学、代码、事实核查),适用于答案有绝对对错、可通过规则验证且能设计客观奖励函数的场景。
- 只做SFT的情况:当任务仅需注入知识或控制格式、基座已是强对齐Chat版本、缺乏偏好数据或验证规则、处于MVP早期或算力受限,或需保留模型发散性防止过度对齐时,仅做SFT即可。
-
问题二:如何训练直播违规校验模型
- 数据获取与准备:收集封禁/举报记录作违规黑样本,正常切片作防误杀白样本,利用大模型生成长尾变种话术;将直播流按时间窗口切片保留上下文,严格区分主播与弹幕角色。
- 人工介入时机:冷启动与新规期由人工标注带推理的种子数据,日常将低置信度或规则冲突的难例推给人工,涉政/涉黄等绝对红线场景必须由人工最终兜底确认。
- 提示词设计:设定专家角色并注入最新规则,提供包含ASR/弹幕/画面的结构化上下文,强制使用思维链(CoT) 按步骤推理,严格限制输出为包含证据的JSON格式。
- 纯0/1标签获取数据:利用强模型反向蒸馏自动生成推理过程作SFT数据,结合传统规则ID扩写审核报告,构造DPO偏好数据(结论正确且逻辑严密为Chosen),或直接将0/1标签作为GRPO客观奖励函数让模型通过强化学习自我摸索推理过程。
京东HR面
- 关键问题,三个词介绍自己
- 第二天早上offer
2026-06-23
B站二面:
- 很深入,问了很多工程上的考量,几乎没有八股。第一段实习做了什么?有哪些学习和成长?基于什么考量从开发转到算法?你指标中胜率的依据是什么?原有测试集中有正确答案吗?原本比赛有其他方案的准确率吗?你为什么觉得你作为裁判的模型能够很好地判断两个回答是好是坏?你的裁判模型本身你是否去验证过能否很好地回答这些问题?凭什么认为裁判模型本身没有幻觉?你认为去做SFT,是否要先去设计提示词使得达到一个比较好的效果?用过哪些框架去训练模型?如果让你基于大模型做分类,你会怎么做?你如何获得输出这些选项回答的置信度?你是否考虑过模型做了SFT之后,其他任务或者原有指令遵循的能力是否受损?你觉得整个过程中,数据,调参,归因分析这些环节,哪一个对于你来说占比最大,具体可能能够占到工程上的多少?给你数据和场景,你一般会怎么做才能更好适应这些场景?RAG的大致过程可以分为哪些?召回和rerank有什么区别?你有没有一些调参技巧?你怎么去看一批数据,从中挖掘你想要的信息?是否会关注训练过程中模型的输出还是只关心一些指标?你认为是数据更重要还是调参更重要,或者你自己的项目中哪一个占比更高?VLM是否了解,对于CV的一些理论是不是清楚?是不是会自己去改框架,调整一些loss函数?你期望获得哪些成长?
- 很有帮助的一次面试,后面查询结果挂
以下是 LLM-as-Judge 注意事项的简短分点总结:
一、 克服固有偏差
- 位置偏差:采用位置交换测试(Swap Test)抵消对特定选项位置的偏好。
- 冗长偏差:在 Prompt 中明示惩罚冗余,或采用长度控制胜率(Length-controlled Win Rates)。
- 自我/权威偏差:隐去模型来源进行盲测,采用不同家族模型进行交叉评估。
- 光环效应:拆解评分维度(如准确性、逻辑性、格式)独立打分,避免以偏概全。
二、 优化 Prompt 与标准
- 细化评分细则:清晰定义每个分数段的具体标准(Rubrics)。
- 强制思维链 (CoT):严格要求 Judge“先输出分析理由,后输出最终分数”。
- 结构化输出:要求输出 JSON/XML 格式,便于代码自动化解析。
- Few-Shot 示例:提供标准评分案例,对齐 Judge 的评分尺度。
三、 评估模式选择
- 成对比较 (Pairwise):首选模式,LLM 判断相对优劣通常比绝对打分更准。
- 单点打分 (Pointwise):需谨慎使用,严格统一分数尺度以防漂移。
- 列表排序 (Listwise):候选回答不宜过多(建议 ≤4 个),防止注意力分散。
四、 模型选择与校准
- 强评弱原则:必须使用能力最强的顶尖模型(如 GPT-4o/Claude)作为 Judge。
- 人类对齐校验:抽样进行人工打分,计算与 LLM 评分的一致性指标(如 Spearman 系数)。
- 多评委机制:引入多个不同的强模型作为 Judge 进行投票或取均值,消除单一偏见。
五、 工程与成本控制
- 降本增效:先小样本验证 Prompt;简单任务可微调轻量级开源模型做专属 Judge。
- 拒答处理:评估体系中需单独考量对“合理安全拒答”与“错误拒答”的识别能力。