大厂真题 / 阿里
阿里 2026-8-29 笔试真题 - 算法岗
本场考试概述
考试时间:2026 年 8 月 29 日
考试岗位:算法岗(计算机视觉方向卷)
难度评级:中等偏难
考试时长:100 分钟
卷面结构:通用技术单选、通用技术多选、五选一方向卷与 1 道 AI Coding。多选题错选不得分,少选得三分之一分。
题目完整性说明:卷面信息称共有 22 道选择题;目前能够核对到完整题干的只有通用技术单选 8 道、通用技术多选 9 道、计算机视觉方向单选 2 道,合计 19 道。其余 3 道计算机视觉方向题题干缺失,本文明确留空,不根据考点概述补写题目。
考点分析:
- 通用技术:K-Means、标签平滑、MoE、长上下文外推、推理时延、二分答案、贝叶斯决策、树状数组。
- 通用多选:决策树、线性层、向量检索、概率统计、语言模型训练数据、带权并查集、消融实验、标签偏移、滑动窗口。
- 计算机视觉:目标检测评估匹配、扩散模型交叉注意力控制。
- AI Coding:有偏曝光日志上的概率预测、组内排序、时间验证、冷启动与输出契约。
建议策略:
- 计算型单选先写公式再代数,尤其注意标签平滑、请求占比与专家容量的口径。
- 多选题只选择能由题干严格推出的结论;“对所有任务都成立”“足以证明因果”一类强断言要重点审查。
- 方向卷先区分评估规则、生成阶段和注意力控制对象,不要只凭术语印象作答。
- AI Coding 先完成数据契约、泄漏审计和可靠验证,再迭代模型;不要在缺少实际数据时预设列名或提交代码。
一、通用技术单选题(8 道)
1. K-Means 迭代与簇内平方和
对一维样本 $[0,0,0,6,10,10,10]$ 执行 $k=2$ 的 K-Means,初始中心为 $0$ 和 $10$;距离相同时分配给数值较小的中心。完成一次“分配—更新”后继续迭代到稳定。稳定后的两个中心及簇内平方和是哪一项?
- A. 中心为 $0$ 和 $9$,簇内平方和为 $12$
- B. 中心为 $1.5$ 和 $10$,簇内平方和为 $27$
- C. 中心为 $0$ 和 $10$,簇内平方和为 $16$
- D. 中心为 $3$ 和 $10$,簇内平方和为 $36$
答案:A
解析:第一次分配时,样本 $6$ 到两个中心的距离分别为 $6$ 和 $4$,因此进入右簇。两簇变为 ${0,0,0}$ 和 ${6,10,10,10}$,新中心为 $0$ 和 $9$。用新中心再次分配时归属不变,算法收敛。簇内平方和为
\[(6-9)^2+3\times(10-9)^2=9+3=12.\]2. 标签平滑交叉熵
分类模型输出 logits 为 $2,1,-1$。训练时使用标签平滑 $\varepsilon=0.1$,正确类目标概率为 $1-\varepsilon$,其余两个类别各为 $\varepsilon/2$。真实类别为第 1 类。哪一项最接近交叉熵损失?
- A. $0.35$
- B. $0.55$
- C. $0.85$
- D. $1.05$
答案:B
解析:Softmax 概率约为 $(0.7054,0.2595,0.0351)$,平滑目标为 $(0.9,0.05,0.05)$。因此
\[-0.9\ln 0.7054-0.05\ln 0.2595-0.05\ln 0.0351\approx 0.5490,\]最接近 $0.55$。选项 A 约等于未使用标签平滑时的硬标签损失。
3. Top-2 MoE 的专家容量
Top-2 MoE 层包含 8 个专家,每个 token 路由到得分最高的两个专家。每个专家容量为批内 token 数的 $0.25$,超出容量的指派被丢弃;token 至少被一个专家接收即可继续计算。现有 8 个 token:$t_1$ 至 $t_4$ 的 Top-2 均为 $(E_1,E_2)$;$t_5,t_6$ 均为 $(E_1,E_3)$;$t_7,t_8$ 均为 $(E_2,E_3)$。各专家按以下顺序接收:
- $E_1:t_1>t_2>t_5>t_6>t_3>t_4$
- $E_2:t_3>t_4>t_7>t_8>t_1>t_2$
- $E_3:t_5>t_6>t_7>t_8$
不进行二次重路由。哪一项正确?
- A. 每个专家容量为 1,共 3 个 token 继续计算
- B. 每个专家容量为 2,共 6 个 token 继续计算
- C. 每个专家容量为 2,共 8 个 token 继续计算
- D. 每个专家容量为 4,共 8 个 token 继续计算
答案:B
解析:每个专家容量为 $8\times0.25=2$。$E_1$ 接收 $t_1,t_2$,$E_2$ 接收 $t_3,t_4$,$E_3$ 接收 $t_5,t_6$。$t_7,t_8$ 的两个候选专家都已满,因而被丢弃。Top-2 只提供两个候选,并不保证至少一个候选仍有容量。
4. 长上下文外推方案选型
Decoder-only 模型使用 RoPE,训练最大长度为 8K。三种 32K 外推配置的离线结果如下:
- P:短文本损失增幅 $0.01$;三个长距离桶准确率 $84\%,72\%,58\%$;P95 时延增幅 $2\%$。
- Q:短文本损失增幅 $0.04$;准确率 $80\%,77\%,74\%$;P95 时延增幅 $7\%$。
- R:短文本损失增幅 $0.02$;准确率 $83\%,76\%,70\%$;P95 时延增幅 $8\%$。
硬约束为:短文本损失增幅不超过 $0.05$、任一距离桶准确率不低于 $70\%$、P95 时延增幅不超过 $8\%$。可行方案中优先选择最末距离桶准确率更高者。决策正确的是?
- A. 选择 P,因为其短文本损失和时延增幅最小
- B. 选择 Q,因为它通过硬约束,且末距离桶准确率在可行方案中最高
- C. 选择 R,因为它通过硬约束,且短文本损失增幅低于 Q
- D. 选择 R,因为它前两个距离桶合计表现高于 Q
答案:B
解析:P 的末距离桶准确率只有 $58\%$,未通过硬约束。Q、R 均可行;边界上的 $70\%$ 与 $8\%$ 也满足“不低于”和“不超过”。题目规定可行后只比较末距离桶,Q 的 $74\%$ 高于 R 的 $70\%$,因此选择 Q。
5. Prefill 与 Decode 加权时延
线上 Decoder-only 服务有两类请求:A 类占 $60\%$,输入 8192 token、输出 64 token,Prefill 为 400 ms,Decode 为每 token 8 ms;B 类占 $40\%$,输入 512 token、输出 512 token,Prefill 为 40 ms,Decode 为每 token 8 ms。只能选择一个方案:
- X:Prefill 加速 2 倍,Decode 不变;
- Y:Decode 降为每 token 6 ms,但每个请求增加 100 ms 适配开销;
- Z:A 类 Prefill 降为 260 ms、Decode 降为每 token 7 ms,B 类不变。
忽略排队和并行重叠,以请求占比加权的平均端到端时延为目标。哪项正确?
- A. X 最优,平均约 2074 ms
- B. Y 最优,平均约 1815 ms
- C. Z 最优,平均约 1769 ms
- D. X 与 Z 并列最优,平均均约 2076 ms
答案:B
解析:逐类计算 Prefill 加输出 token 的 Decode 时间:
- X:$0.6\times(200+64\times8)+0.4\times(20+512\times8)=2073.6$ ms;
- Y:$0.6\times(400+64\times6+100)+0.4\times(40+512\times6+100)=1815.2$ ms;
- Z:$0.6\times(260+64\times7)+0.4\times(40+512\times8)=2079.2$ ms。
因此 Y 最优。B 类输出很长,Decode 是加权时延的主要部分。
6. 连续分批的最小最大代价
8 个任务必须保持原顺序,并切分为不超过 3 个连续批次。耗时依次为 $[7,2,5,10,8,4,6,9]$。批次代价为其中任务耗时之和,目标是最小化最大批次代价。若用“给定上限 $M$ 时从左到右贪心装批次”作为二分判定,最优的 $M$ 是多少?
- A. $18$
- B. $19$
- C. $20$
- D. $21$
答案:B
解析:当 $M=18$ 时,贪心批次依次为 $[7,2,5]$、$[10,8]$、$[4,6]$、$[9]$,需要 4 批,不可行。当 $M=19$ 时,可分为 $[7,2,5]$、$[10,8]$、$[4,6,9]$,恰好 3 批。可行性随 $M$ 单调,故最小可行值为 $19$。
7. 带人工复核的贝叶斯决策
二分类系统可以自动判正、自动判负或转人工复核。自动判正的假阳性损失为 4,自动判负的假阴性损失为 9,正确自动分类损失为 0;人工复核总能给出正确类别,但固定损失为 1。设 $p=P(Y=1\mid x)$,系统按条件期望损失最小选择动作;风险相等时优先人工复核。什么条件下应自动判正?
- A. $p>0.75$
- B. $p>4/13$
- C. $4/13<p\leq0.75$
- D. $p\geq0.75$
答案:A
解析:三个动作的风险分别为 $4(1-p)$、$9p$ 和 $1$。自动判正必须严格优于其余两者:
\[4(1-p)<9p,\qquad 4(1-p)<1.\]分别得到 $p>4/13$ 和 $p>0.75$,交集为 $p>0.75$。在 $p=0.75$ 时自动判正与人工复核风险相同,应按题意选择人工复核。
8. 树状数组的查询与更新路径
采用 1 下标的树状数组,长度为 16。$\operatorname{lowbit}(i)$ 表示 $i$ 的二进制表示中最低位 1 所代表的数值;节点 $T[i]$ 覆盖区间 $[i-\operatorname{lowbit}(i)+1,i]$。现计算前缀和 $P(13)$,同时将原数组第 5 个元素增加 $\Delta$。哪项描述正确?
- A. 查询路径为 $13\to12\to8\to0$,$T[12]$ 覆盖 $[9,12]$;更新路径为 $5\to6\to8\to16$
- B. 查询路径为 $13\to12\to8\to0$,$T[12]$ 覆盖 $[8,12]$;更新路径为 $5\to6\to10\to16$
- C. 查询路径为 $13\to9\to1\to0$,$T[9]$ 覆盖 $[8,9]$;更新路径为 $5\to7\to11\to15$
- D. 查询路径为 $13\to12\to4\to0$,$T[12]$ 覆盖 $[9,12]$;更新路径为 $5\to6\to8\to16$
答案:A
解析:前缀查询反复执行 $i\mathrel{-}=\operatorname{lowbit}(i)$,得到 $13\to12\to8\to0$。$\operatorname{lowbit}(12)=4$,所以 $T[12]$ 覆盖 $[9,12]$。单点更新反复执行 $i\mathrel{+}=\operatorname{lowbit}(i)$,得到 $5\to6\to8\to16$。
二、通用技术多选题(9 道)
记分规则:错选不得分,少选得三分之一分。
1. 决策树过拟合
训练决策树时,训练误差很低而验证误差明显较高。合理的处理或判断有哪些?
- A. 增大叶节点所需的最小样本数,限制细碎分支
- B. 使用独立验证数据选择剪枝强度,比较候选树的泛化表现
- C. 复制同一棵树多次再平均,可获得与随机森林相同的方差降低效果
- D. 限制最大深度通常会降低模型复杂度,但训练误差可能升高或保持不变
答案:A、B、D
解析:A 是预剪枝,B 是用验证集选择后剪枝强度,D 符合模型容量受限后的训练误差性质。C 错在所有副本完全相同,平均不会降低方差;随机森林依赖数据和特征随机化来降低基学习器之间的相关性。
2. 连续线性层与非线性
前馈网络含两个连续线性层,中间没有激活、归一化或其他非线性操作:$h=W_1x+b_1$,$y=W_2h+b_2$。正确判断有哪些?
- A. 两层可合并为 $y=(W_2W_1)x+(W_2b_1+b_2)$
- B. 扩大中间隐藏维度仍只得到仿射映射,不会自行产生非线性表达能力
- C. 中间加入 ReLU 后,整体通常成为分段线性映射
- D. 中间加入 ReLU 后,仍可在全部输入域按原矩阵乘积合并为同一仿射映射
答案:A、B、C
解析:直接代入可得 A。中间维度会影响乘积矩阵可能达到的秩,但不会改变仿射性质,因此 B 正确。ReLU 会根据输入改变激活模式,使整体成为分段线性映射,故 C 正确、D 错误。
3. 最大内积检索中的文档权重
稠密检索系统把查询和文档向量都做 L2 归一化,并使用最大内积 ANN 索引。希望给每个文档加入正的新鲜度权重 $w_d$,最终分数为 $w_d(q\cdot d)$。正确判断有哪些?
- A. 将 $w_d\,d$ 写入最大内积索引,可由文档范数承载权重
- B. 若写入后再次独立归一化每个 $w_d\,d$,新鲜度权重的排序作用会消失
- C. 将查询向量统一乘同一正数,可以替代各文档不同的 $w_d$
- D. 若 ANN 内部强制按余弦归一化,应在候选融合或重排阶段显式加入权重
答案:A、B、D
解析:最大内积下 $q\cdot(w_d\,d)=w_d(q\cdot d)$,所以 A 正确。由于 $w_d>0$,再次单位化会把标量消去,B 正确。统一缩放查询只会把所有分数乘以同一个正数,不能表达逐文档权重,C 错误。若索引强制归一化,则只能在召回后显式融合权重,D 正确;实践中还需留意召回阶段可能漏掉高权重但原始相似度一般的文档。
4. 仿射变换后的协方差与相关系数
随机变量 $X,Y$ 的二阶矩存在,方差均大于 0,相关系数为 $\rho$。令 $U=X+3$,$V=-2Y+5$。正确判断有哪些?
- A. $\operatorname{Cov}(U,V)=2\operatorname{Cov}(X,Y)$
- B. $\operatorname{Corr}(U,V)=-\rho$
- C. 若 $X,Y$ 相互独立,则 $\operatorname{Cov}(U,V)=0$
- D. 若 $\operatorname{Cov}(U,V)=0$,则 $X,Y$ 相互独立
答案:B、C
解析:平移不改变协方差,数乘会保留符号,因此 $\operatorname{Cov}(U,V)=-2\operatorname{Cov}(X,Y)$,A 错。相关系数分母中的标准差乘以 $2$,故只翻转符号,B 正确。独立蕴含不相关,所以 C 正确;一般情形下不相关不能推出独立,D 错误。
5. PT、SFT 与偏好数据的最小样本
只依据监督信号,哪些记录可直接构成对应阶段的一条有效训练样本?
- A. PT 记录包含连续文本及其自回归移位目标
- B. SFT 记录包含输入上下文和期望回答
- C. 偏好记录包含同一输入下的 chosen 与 rejected 回答
- D. SFT 记录只包含用户输入和奖励标量,可按目标回答计算 token 级交叉熵
答案:A、B、C
解析:预训练目标可由连续文本右移得到;SFT 需要上下文与目标回答;偏好学习需要同一输入下可比较的回答。D 没有目标回答序列,无法计算目标回答的 token 级交叉熵。
6. 带权并查集
带权并查集用 parent[v] 表示父节点,并定义 $w[v]=\operatorname{value}(v)/\operatorname{value}(\operatorname{parent}(v))$;根节点父亲为自身。查询时进行路径压缩。正确判断有哪些?
- A. 压缩前 $a$ 的父节点为 $b$、$b$ 的父节点为根 $r$,且 $w[a]=2,w[b]=3$;将 $a$ 直接挂到 $r$ 后应令 $w[a]=6$
- B. 已知 $\operatorname{value}(x)/\operatorname{value}(r_x)=2$、$\operatorname{value}(y)/\operatorname{value}(r_y)=5$,新增关系 $\operatorname{value}(x)/\operatorname{value}(y)=4$;若将根 $r_x$ 挂到 $r_y$ 下,应令 $w[r_x]=10$
- C. 根节点的 $w$ 可以保留为任意非零数,因为查询变量比值时最终会抵消
- D. 若新增关系连接的两点已在同一集合,可与现有路径推导的比值比较,以检测约束冲突
答案:A、B、D
解析:权值沿父链连乘,所以 A 中新权值为 $2\times3=6$。B 中
\[\frac{\operatorname{value}(r_x)}{\operatorname{value}(r_y)} =\frac{\operatorname{value}(x)/2}{\operatorname{value}(y)/5} =\frac{5}{2}\times4=10.\]根指向自身,按定义其权值必须为 $1$,C 错。已连通两点的比值已由路径确定,可用于一致性检查,D 正确。
7. 2×2 消融实验解读
长上下文模型的数据审计使用相同初始化、优化器和训练步数,得到以下 CPT/SFT 实验:
- R00:不屏蔽 CPT 跨文档边界,不补回 SFT 缺失证据;长距离 NLL 为 $2.40$,事实正确率 $51\%$。
- R10:仅屏蔽边界;NLL 为 $2.02$,事实正确率 $52\%$。
- R01:仅补回证据;NLL 为 $2.39$,事实正确率 $65\%$。
- R11:同时修复;NLL 为 $1.96$,事实正确率 $70\%$。
随后用 R11 偏好优化:chosen 与 rejected 使用同一知识快照时,胜率提高 8 个百分点;使用不同快照时,提高 18 个百分点。正确判断有哪些?
- A. R10 与 R00 支持边界屏蔽主要改善长距离建模,但不足以证明其单独显著提升事实正确率
- B. 两项修复对事实正确率存在约 4 个百分点的正交互项
- C. 异快照子集比同快照子集多出的 10 个百分点,可能同时受到证据质量或样本难度差异影响
- D. R11 改善两个指标,证明两项修复对所有长上下文任务都分别必要
答案:A、B、C
解析:R00 到 R10 的 NLL 明显下降,而事实正确率只提高 1 个百分点,A 的谨慎结论成立。若两项作用可加,R11 的事实正确率应为 $51\%+1\%+14\%=66\%$,实际为 $70\%$,正交互约为 4 个百分点,B 正确。两个快照子集并非随机控制实验,差值可能有混杂,C 正确。D 把当前评测外推到所有任务,并把联合改善误写成分别必要,结论过强。
8. 标签偏移估计与校正
训练域类别先验为 $p_s(y)$。分类器固定后,线上无标签数据的预测类别比例为 $\mu$。在独立训练域验证集上已估计混淆矩阵 $C_{ij}=P_s(\hat y=i\mid y=j)$。假设线上仅发生标签偏移,即 $P_t(x\mid y)=P_s(x\mid y)$,并另留少量线上标注样本用于最终审计。合理处理有哪些?
- A. 在概率单纯形约束下求解 $\mu=Cq$ 以估计线上先验 $q$,避免在 $C$ 病态时直接无约束求逆
- B. 得到 $q$ 后,将源域后验按 $q_y/p_s(y)$ 校正,再对所有类别重新归一化
- C. 在无标签线上数据上联合优化温度和伪标签,使预测熵最低,并以熵下降作为标签偏移假设成立的依据
- D. 检查 $C$ 的条件数及先验估计敏感性,并用预留标注样本检验类条件分布稳定性和校正效果
答案:A、B、D
解析:A 是带非负与和为 1 约束的稳健先验估计;直接求逆会在矩阵病态时放大噪声。标签偏移下有
\[P_t(y\mid x)\propto P_s(y\mid x)\frac{q_y}{p_s(y)},\]所以 B 正确。熵下降只说明模型变得更自信,不能证明标签偏移假设成立,C 错误。条件数、敏感性和线上标注审计都是必要的可靠性检查,D 正确。
9. 非负数组上的滑动窗口
以下滑动窗口算法用于在非负整数数组 $a$ 中求“元素和不超过 $T$ 的最长连续子数组长度”:右指针加入元素,窗口和大于 $T$ 时用 while 不断移出左端,恢复合法后更新答案。对 $a=[2,1,3,0,2,1]$、$T=5$,正确判断有哪些?
- A. 最长合法窗口长度为 3,且不存在长度 4 的合法窗口
- B. 元素均非负时,每个元素至多进入和离开窗口一次,时间复杂度为 $O(n)$
- C. 数组允许负数时,仍可在窗口和超过 $T$ 时收缩左端,原策略不会漏解
- D. 对一般非负数组,即使每个元素均不超过 $T$,把
while改成if仍可能留下超限窗口
答案:A、B、D
解析:三个长度为 4 的窗口之和都为 $6$,而存在长度为 3、和不超过 $5$ 的窗口,所以 A 正确。左右指针都只前进,B 正确。有负数后,扩张与收缩对窗口和不再具有所需单调性,原策略会漏解,C 错。D 可由 $[1,1,5]$、$T=5$ 验证:加入 5 后只移出一个 1,窗口和仍为 6,因此必须持续收缩到合法。
三、计算机视觉方向卷(现存 2 道单选)
1. 目标检测评估中的贪心匹配
同一类别有两个标注框 $G_1,G_2$。按置信度从高到低只有两个预测框 $D_1,D_2$,IoU 如下:$D_1$ 对 $G_1,G_2$ 分别为 $0.74,0.71$;$D_2$ 对二者分别为 $0.69,0.18$。评估阈值为 $0.5$,并按预测顺序把每个预测贪心匹配到 IoU 最大的尚未匹配标注。预测标签与召回率是哪一项?
- A. $D_1$ 为 TP、$D_2$ 为 FP,召回率为 $0.5$
- B. $D_1$ 为 TP、$D_2$ 为 TP,召回率为 $1.0$
- C. $D_1$ 为 FP、$D_2$ 为 TP,召回率为 $0.5$
- D. $D_1$ 为 TP、$D_2$ 为 FP,召回率为 $1.0$
答案:A
解析:$D_1$ 先选择 IoU 更大的 $G_1$,超过阈值,记为 TP,且 $G_1$ 被占用。处理 $D_2$ 时只剩 $G_2$,对应 IoU 为 $0.18$,因此记为 FP。两个标注只召回一个,召回率为 $1/2=0.5$。
2. 扩散模型的交叉注意力控制
源提示为 “a red car beside a tree”,目标提示为 “a blue car beside a tree”。两次采样使用相同初始噪声,希望保留车辆位置、树木和整体构图,同时允许颜色改变。将采样前段定义为高噪声、主要形成粗略空间布局的阶段。哪种方式更合理?
- A. 对齐共享 token,前段注入共享 token 的源交叉注意力;颜色 token 使用目标注意力,后段逐步释放注入
- B. 对齐共享 token,前段注入颜色 token 的源交叉注意力;共享 token 使用目标注意力,后段持续冻结颜色
- C. 前后段都注入全部源交叉注意力;颜色变化仅通过替换目标提示的文本嵌入实现
- D. 前后段都使用全部目标交叉注意力;构图保持只依赖相同初始噪声
答案:A
解析:高噪声阶段主要确定布局。对共享语义注入源注意力有助于保持车、树与相对位置;发生替换的颜色 token 应采用目标侧控制,才能允许红色变为蓝色。后段逐步释放约束,则为新颜色和纹理细化保留自由度。其余选项要么锁住了待修改属性,要么不足以稳定保持构图。
题干缺失项
计算机视觉方向卷另有 3 道选择题,但没有可核对的题干、选项和必要参数。已知的题型概述不足以唯一恢复原题,因此本文不补写题目,也不提供推测答案。
四、AI Coding:短视频冷启动完播概率预测
题型说明
本题要求根据历史展示日志,为当前完整候选池中的短视频估计有效完播概率,并在同一请求内让高概率候选优先。程序以命令行方式读取 CSV、输出 CSV;输出必须与输入逐行对应,只包含 candidate_id 和 completion_probability 两列,概率必须是 $[0,1]$ 内的有限浮点数。
可确认的运行条件包括 Python 3.11,仅可使用 NumPy、pandas 和 scikit-learn,禁止联网或安装额外依赖;常见路径应在 60 秒内完成,完整路径不得超过 120 秒,随机过程需要固定种子。训练数据约 9225 行,验证数据约 2166 行,且验证数据时间晚于训练数据。
由于没有实际 CSV、字段说明文件和完整数据样例,本节只整理建模与验收策略,不提供臆造的数据字段、可执行代码或虚构实验分数。
1. 先锁定输入输出契约
开始建模前先机械核对:
- 从正式字段说明中区分展示前可用信息、训练标签和仅存在于历史展示日志中的信息;
- 只把预测时确实存在的展示前信息放入特征矩阵;
- 历史展示机制相关信息即使与标签高度相关,也不能直接当作线上特征;
- 保存输入行序,在输出阶段严格还原;
- 输出行数必须等于输入行数,候选 ID 不遗漏、不重复、不新增;
- 概率不得出现 NaN、无穷值或越界值,列名与列顺序必须完全匹配要求。
这一步优先级高于模型调参。离线表现异常好的特征首先应接受时间穿越、展示后信息和目标泄漏检查。
2. 处理曝光选择偏差
历史日志只包含曾被展示的候选,而预测对象是完整候选池,训练样本并不是从目标候选分布中均匀抽取的。若题面提供每条历史记录进入日志的曝光概率,可将其用于逆倾向加权:样本权重与曝光概率的倒数相关,并设置合理上限,避免极小曝光概率造成方差爆炸。
倾向信息的用途是修正训练权重,而不是成为预测特征。是否采用、如何截断以及截断阈值,都应在时间靠后的验证集上比较稳定性,不能脱离数据预设数值。
3. 同时关注概率校准与请求内排序
评价目标同时包含两层含义:
- 概率误差小,要求输出概率具有良好校准性;
- 有限展示位捕获更多有效完播,要求同一请求内排序有效。
因此验证时至少分别观察概率损失、校准表现和请求内排序指标。基础模型可从适合小规模表格数据、训练稳定的概率模型开始,再根据验证结果考虑校准。若构造请求内相对特征,必须确保它们只依赖当前请求在预测时可见的候选信息,例如某数值相对组内统计量的位置;不能混入标签或历史展示结果。
校准器也只能在训练流程内部拟合。不能在最终验证集上拟合后又用同一数据报告性能,否则会造成评估泄漏。
4. 冷启动与高基数实体
正式输入可能出现历史中未出现的创作者。高基数身份直接独热编码或无平滑记忆历史标签均值,容易在小数据上过拟合,并对新实体失效。更稳妥的原则是:
- 优先使用预测时可得、能够跨实体泛化的统计或内容特征;
- 如果根据训练数据构造目标编码,必须使用折外计算或严格的时间前推计算;
- 对低频与未见实体设置回退值,并用先验平滑降低小样本方差;
- 单独报告已见实体与未见实体上的指标,确认总体提升不是以冷启动退化为代价。
具体采用哪些实体与统计特征,必须以实际字段说明为准。
5. 验证方案
验证集时间晚于训练集,说明随机拆分不能作为主验证方式。推荐按以下顺序检查:
- 使用给定的后时段验证集模拟真实分布变化;
- 调参阶段也保持时间顺序,避免未来样本参与过去样本的特征统计;
- 需要额外切分时,以请求为整体,避免同一请求候选跨越训练和验证;
- 分别审计整体、请求内排序、冷启动子集和概率分桶;
- 每轮只改变一个因素,并记录验证指标、耗时和异常情况。
如果类别比例或流量构成随时间变化,除总体指标外还应检查分时段、分群体结果,防止平均值掩盖局部失效。
6. 限时实现顺序
- 第一阶段:跑通基线。 完成读取、字段筛选、缺失值处理、基础模型和合规输出。
- 第二阶段:建立可信验证。 固定时间验证与请求分组规则,检查泄漏和概率分布。
- 第三阶段:处理选择偏差与冷启动。 分别测试样本加权、平滑统计和回退策略。
- 第四阶段:优化校准与组内排序。 只保留在后时段验证中稳定有效的改动。
- 第五阶段:做提交前验收。 在输入行重排、缺失值、新类别和不同候选数量下复测输出契约,并记录最坏运行时间。
在没有实际数据的情况下,无法判断哪种模型、权重截断或校准方法一定最优;这些都应作为待验证假设,而不是题目答案。
小结
- 当前可核对的选择题共 19 道,而非 22 道;缺失的 3 道方向题没有被补造。
- 通用单选强调按题面口径计算,关键是容量、边界、动作风险和加权时延。
- 通用多选强调结论边界:相关不等于独立,消融改善不等于普遍必要,熵下降也不能证明分布偏移假设。
- 计算机视觉题分别考查一对一贪心匹配和扩散模型中“保布局、改属性”的注意力控制。
- AI Coding 的核心不是凭空堆模型,而是避免展示偏差与信息泄漏,同时兼顾概率校准、请求内排序、冷启动和严格输出契约。