大厂真题 / 阿里
阿里 8.15 笔试真题 - Agent 岗
本场考试概述
考试时间:2026 年 8 月 15 日
考试岗位:Agent 岗
考试时长:100 分钟
已知卷面结构:通用技术单选 8 道、通用技术多选 9 道;方向卷从计算机视觉、自然语言处理、推荐与信息检索、运筹、语音处理中五选一;另有 1 道 AI Coding 题。
本文收录范围:本文整理16道已披露题目,包括通用单选 6 道、通用多选 6 道、自然语言处理方向单选 2 道、自然语言处理方向多选 2 道。题号按本文顺序重新编排,并非完整试卷题号。由于 AI Coding 题的可靠题面未披露,本文不补写、不猜测该题内容。
多选题计分规则:错选不得分,少选得该题三分之一分。作答时应优先确认必选项,不要凭感觉扩大答案集合。
这组题并不只考概念记忆。大量题目给出工程现象,要求判断问题位于检索、生成、预填充、解码或评测设计中的哪一环。复习时应把“指标或症状—可能原因—验证方法—改进手段”串联起来。
考点分布
| 考点方向 | 题数 | 对应题目 |
|---|---|---|
| 大模型与 Agent(生成、长上下文、推理、RAG、训练、评测) | 8 | 通用单选 3、4、6;通用多选 4、5、6;NLP 单选 1、2 |
| 深度学习(注意力、序列标注) | 3 | 通用单选 5;通用多选 3;NLP 多选 1 |
| 算法与数据结构 | 2 | 通用单选 1;通用多选 2 |
| 概率统计 | 1 | 通用单选 2 |
| 机器学习与集成学习 | 1 | 通用多选 1 |
| 偏好后训练与统计解读 | 1 | NLP 多选 2 |
部分题目同时覆盖多个知识点,表中按主要考查方向归类。
一、通用技术 · 单选题(6 道)
1. AVL 树旋转
将 30、20、40、10、25、22 依次插入一棵初始为空的 AVL 树。完成全部必要的旋转后,最终根节点的值是多少?
A. 20
B. 22
C. 25
D. 30
答案:C
考点:数据结构、AVL 树、LR 双旋
解析:插入 22 后,节点 30 左高右低,且新节点位于其左孩子 20 的右子树中,构成 LR 型失衡。先对 20 左旋,再对 30 右旋,最终根节点为 25。
2. 配对数据的 Bootstrap
使用同一批用户的曝光日志比较模型 A 和模型 B。每个用户可能产生多次曝光,现需估计两个模型指标差的置信区间。以下哪种重采样方式更合适?
A. 将每次曝光视为独立样本,分别重采样 A、B 结果后比较指标均值
B. 按用户成组重采样,并在每次抽样后重算 A、B 指标差
C. 将用户随机分成两半,一半只计算 A,另一半只计算 B,再比较指标
D. 保留全部曝光不重采样,按曝光数直接使用独立同分布的正态近似
答案:B
考点:概率统计、Cluster Bootstrap、配对实验
解析:同一用户的多次曝光存在组内相关性,A、B 又作用于同一批用户。以用户为单位成组抽样可以保留相关结构;每次直接计算配对差值,则能利用共同用户带来的方差抵消。按曝光独立抽样会虚增有效样本量并低估不确定性。
3. 温度采样
大语言模型生成文本时,保持各词元的 logits 不变且最高得分词元唯一,将采样温度由 1 调整为 0.5。以下说法正确的是?
A. 分布更集中,最高分词元概率上升,最高分词元不变
B. 分布更平坦,低分词元概率上升,最高分词元不变
C. 各词元概率按相同比例减半,归一化后的结果保持不变
D. 只有生成速度降低,词元概率分布和采样结果均不会变化
答案:A
考点:大模型生成、Softmax、温度参数
解析:采样概率满足 $p_i\propto\exp(z_i/T)$。温度从 1 降到 0.5,相当于放大 logits 之间的差距,概率分布会更尖锐;正比例缩放不改变 logits 排序,因此唯一的最高分词元不变,但其概率会上升。
4. RoPE 长上下文扩展
一个使用旋转位置编码(RoPE)的模型从 8K 上下文扩展到 64K。直接使用原训练配置后,短文本表现基本不变,但长文本中相隔很远的 token 更容易出现位置关系混淆。以下判断最严谨的是?
A. 保持位置频率不变,重点增加解码并行度与批处理规模以改善长距离位置关系
B. 比较不同 RoPE 缩放配置在长上下文和远距离依赖上的表现,必要时补充长上下文训练
C. 扩大 KV Cache 容量后,主要用短文本基准确认上下文扩展是否成功
D. 保持原 RoPE 配置,将超过 8K 的位置编号映射回已有位置区间进行复用
答案:B
考点:位置编码、RoPE 缩放、长上下文外推
解析:问题出现在训练长度之外的相对位置建模,应比较位置插值、频率缩放等方案,并用真正覆盖长距离依赖的任务验收,必要时加入长上下文继续训练。并行度和 KV Cache 容量解决的是性能或容量问题,不能修复位置表示;复用位置编号还会直接造成位置冲突。
5. 无位置编码时的注意力性质
不加入位置编码时,若重新排列输入的 token,关于编码器中的全连接自注意力与解码器中的因果自注意力,下列判断正确的是?
A. 两者均为置换不变,重排输入不会改变输出内容
B. 前者不保持置换等变,后者仍会随输入同步重排
C. 前者保持置换等变,后者通常不保持这一性质
D. 两者均保持置换等变,因果掩码不会改变这一性质
答案:C
考点:Transformer、自注意力、置换等变性
解析:不带位置编码的全连接自注意力对输入置换是等变的:输入怎样重排,输出就对应重排。因果掩码则按位置规定可见前缀,重排 token 后可见集合发生变化,因此通常不再保持同样的置换等变性。注意“等变”不等于输出完全不变。
6. LLM 推理瓶颈定位
某推理服务在回答简短问题时延迟正常;当提示词要求模型输出较长的逐步推理过程时,首个 token 的等待时间变化不大,但后续生成速度明显变慢,总耗时随输出长度增长。此时应优先优化哪个环节?
A. 解码阶段的逐 token 计算、KV Cache 访问与连续批处理
B. 预填充阶段对输入 token 的并行计算与提示词编码
C. 向量检索阶段的索引构建、召回数量与文档切分
D. 训练阶段的数据清洗、学习率调度与检查点保存
答案:A
考点:LLM 推理、Prefill/Decode、KV Cache
解析:首 token 等待时间近似反映预填充成本,后续 token 速度则由解码阶段决定。题目中首 token 基本正常、长输出阶段明显变慢,说明应优先检查逐 token 解码、KV Cache 访存和连续批处理,而不是检索或离线训练。
二、通用技术 · 多选题(6 道)
1. Bagging、Boosting 与决策树
关于 Bagging、Boosting 和决策树,以下哪些说法正确?
A. Bagging 通常基于重采样数据并行训练多个基模型,再聚合预测结果
B. Boosting 通常顺序训练多个基学习器,使后续模型重点修正已有错误
C. 决策树每次选择纯度提升最大的划分,都能保证测试误差持续下降
D. 只要继续增加决策树深度,训练误差和泛化误差都会同步持续下降
答案:A、B
考点:集成学习、决策树、偏差与方差
解析:Bagging 借助重采样和并行聚合降低方差;Boosting 串行训练,使后续学习器修正已有误差。决策树的贪心划分只针对训练数据的局部目标,树过深会过拟合,因此测试误差和泛化误差并不保证持续下降。
2. lower_bound 与闭区间计数
一个检索模块维护非降序数组 [1,2,2,2,5,7],下标从 0 开始。定义 lower(x) 为第一个值大于等于 x 的元素下标;若不存在则返回数组长度 6。模块准备利用查找结果之差统计数组中值落在闭区间 [L,R] 中的元素数量。按照上述查找规则和区间统计要求,以下哪些判断正确?
A. 对当前数组,lower(2) 返回 1,因为下标 1 是第一个值不小于 2 的位置
B. 统计闭区间 [2,5] 时,lower(6)-lower(2) 返回 4,正好覆盖三个 2 和一个 5
C. 对当前数组,lower(6) 的结果为 6,因为数组中没有等于 6 的元素,应返回数组长度
D. 当 R 是整数类型最大值时,仍可先计算 R+1 再调用 lower;查找函数会处理没有匹配值的情况
答案:A、B
考点:二分查找、边界语义、整数溢出
解析:lower(2)=1;lower(6) 找到的是第一个不小于 6 的元素,即下标 5 处的 7,所以 [2,5] 的数量为 $5-1=4$。C 把 lower bound 误解为精确查找;D 在 R 为类型最大值时会先发生 R+1 溢出,不能依赖查找函数补救。
3. 线性注意力替换
准备将长序列模型中的全量注意力(full attention)替换为线性注意力(linear attention)。在评估该方案时,以下哪些判断合理?
A. 全量注意力显式建模 token 两两交互时,计算或存储开销通常随序列长度平方增长
B. 部分线性注意力通过核映射或状态累积重排计算,可降低长序列开销
C. 沿用相同 Q/K/V 投影后,可直接按全量注意力的效果基线评估,无需重测排序关系
D. 若任务依赖精确远距离匹配,应单独验证替换后的召回和长程依赖能力
答案:A、B、D
考点:注意力复杂度、线性注意力、长程依赖
解析:全量注意力需要形成 token 两两交互,通常具有 $O(n^2)$ 级开销。线性注意力可通过核映射或状态压缩降低复杂度,但它改变了注意力计算与归一化方式,即使复用 Q/K/V 参数,效果也不能视为等价。对精确远距离检索敏感的任务必须重新评测。
4. PT、SFT 与反馈后训练
关于预训练(PT)、监督微调(SFT)和基于反馈的强化学习阶段,以下哪些说法正确?
A. 强化学习阶段可利用奖励或偏好信号优化模型行为
B. SFT 只修改推理时的提示词,不会更新模型参数
C. 预训练可通过大规模语料学习语言规律和通用表示
D. SFT 通常使用输入与目标输出样本调整模型参数
答案:A、C、D
考点:大模型训练流程、SFT、偏好对齐
解析:预训练从大规模语料中学习通用能力;SFT 使用输入—目标输出对进行有监督参数更新;反馈后训练则利用奖励或偏好信号调整模型行为。只改变推理提示词属于提示工程,不是 SFT。
5. Embedding 模型升级与检索一致性
团队为文档问答系统升级 Embedding 模型,并使用近似最近邻索引进行召回。若希望检索结果稳定且便于评估,以下哪些做法合理?
A. 把内积作为余弦相似度的实现时,不再统一查询和文档的归一化流程
B. 先召回候选文档,再按需要使用更精细的模型进行重排
C. 新旧模型维度一致时,先保留旧文档向量并只更新查询向量进行评估
D. 查询和文档使用兼容的模型版本及相同的向量处理方式
答案:B、D
考点:RAG、向量检索、召回与重排
解析:向量召回后接精排是兼顾效率与精度的常见设计。查询与文档必须处于兼容的向量空间,并使用一致的预处理和归一化。维度相同不代表新旧模型的坐标空间兼容;若以归一化内积实现余弦相似度,两侧也都必须执行一致的 L2 归一化。
6. Agent 方案评测
比较两个可调用工具的 Agent 方案,希望判断新方案是否在真实任务上稳定提升。以下哪些评测设计合理?
A. 在同一批任务和相同工具版本下运行方案,并按任务配对比较结果
B. 除任务成功率外,同时记录工具调用正确性、执行延迟和运行成本
C. 分别在最终测试集上挑选两个方案的最佳提示词,再比较最高得分
D. 自动裁判多次评分较一致时,无需人工抽检即可作为最终评价标准
答案:A、B
考点:Agent 评测、配对实验、测试集泄漏
解析:固定任务和工具版本并做配对比较,能够减少任务难度与外部工具变化造成的噪声。成功率也应与工具调用质量、延迟和成本共同报告。直接在测试集上挑提示词会导致测试集泄漏;自动裁判的一致性只代表稳定,不代表判断无偏,仍需人工抽检校准。
三、自然语言处理方向 · 单选题(2 道)
1. RAG 索引无中断更新
企业 RAG 知识库每天全量更新一次,Embedding 模型保持不变。更新期间要求线上查询不中断,并且一次查询不能同时召回新旧版本的文档片段。以下哪种索引更新方案更合适?
A. 离线构建新版本索引,校验后原子切换检索别名
B. 在线逐条删除旧向量,删除完成后再写入新向量
C. 先用新语料继续预训练模型,再保留原有检索索引
D. 把新旧文档同时追加到当前索引,由生成模型自行去重
答案:A
考点:RAG 工程、索引更新、蓝绿切换
解析:离线构建并校验新索引,最后原子切换别名,可让旧索引持续服务,同时保证单次查询只访问一个完整版本。逐条删写会出现缺失或混合窗口;新旧内容共存也直接违反版本一致性要求。
2. RAG 幻觉问题定位
某 RAG 问答系统升级后,离线评测显示 Recall@5 从 0.62 升至 0.88,重排 nDCG@5 从 0.71 升至 0.84,但答案忠实度仍为 0.54,且大量回答包含检索片段中不存在的断言。下一步最应优先改进哪个环节?
A. 继续扩大召回 top-k,并把更多候选片段写入上下文
B. 更换 Embedding 模型,并重新训练检索与重排索引
C. 约束生成仅使用证据,并对无依据问题拒答
D. 增大文档切片长度,并取消重叠以减少重复上下文
答案:C
考点:RAG 评测、忠实度、幻觉抑制
解析:召回率和排序质量均已明显改善,而低忠实度与无证据断言直接指向生成阶段。应优先让回答绑定检索证据,并在证据不足时允许拒答。继续增加上下文可能引入更多噪声,不能针对性解决生成幻觉。
四、自然语言处理方向 · 多选题(2 道)
1. 线性链 CRF 与维特比解码
某命名实体识别模型对句子中的每个 token 输出 BIO 标签的发射分数。第二个位置的最高发射标签是 O,但加入线性链 CRF 后,维特比解码选择了 I-ORG,使完整路径成为合法的 B-ORG、I-ORG。以下判断正确的有哪些?
A. 线性链 CRF 采用逐位置归一化计算序列条件概率
B. 路径总分同时包含发射分数与标签转移分数
C. 维特比先固定逐位置最高标签再计算路径转移分数
D. 调整转移分数可改变路径而无需重算编码表示
答案:B、D
考点:序列标注、线性链 CRF、维特比算法
解析:CRF 对完整标签序列进行全局归一化,路径分数由各位置发射分数和相邻标签转移分数共同组成。维特比动态规划寻找全局最优路径,并非先固定每个位置的局部最优标签。编码器发射分数不变时,调整 CRF 转移矩阵后只需重新解码即可改变最优路径。
2. 偏好后训练结果解读
某对话语言模型完成偏好后训练,相对训练前模型进行同分布盲测时,后训练模型的胜率为 62%,无差别水平为 50%,该胜率的 95% 置信区间为 [58%, 66%];事实问答得分保持 71 分,分布外良性请求的拒答率从 4% 升至 13%。根据这些结果,可以得出哪些结论?
A. 该偏好集上的胜率提升具有统计支持
B. 事实得分不变更可能由评测集难度不足造成
C. 拒答率变化应纳入后训练收益与代价评估
D. 现有结果支持将偏好收益外推到分布外任务
答案:A、C
考点:偏好后训练、置信区间、分布外评测
解析:95% 置信区间完全高于 50%,因此同分布偏好胜率提升具有统计支持。良性请求拒答率明显上升,是可用性代价,必须与收益一并报告。事实得分不变不能在没有额外证据时归因于题目太简单;同分布胜率也不能直接外推到分布外任务。
总结
这 16 道已披露选择题呈现出三条明显主线:
- 先定位链路,再选择优化手段:首 token 与后续生成速度分别对应 Prefill 和 Decode;召回、排序指标改善但忠实度不升,应检查生成约束,而不是继续堆检索能力。
- 近似与升级都要验证隐性代价:线性注意力降低复杂度,却可能损伤精确长程匹配;Embedding 模型即使维度相同,也不能混用新查询向量与旧文档向量。
- 评测设计本身就是考点:配对比较、按用户成组重采样、测试集隔离、自动裁判人工校准,以及分布内结论不可随意外推,都是 Agent 实验中常见的工程要求。
传统基础同样不能忽略:AVL 的 LR 双旋、lower_bound 的边界语义、决策树过拟合、CRF 的全局解码都可能直接决定得分。复习时既要掌握定义,也要练习从现象判断瓶颈、从实验口径识别偏差。
再次说明:本文整理16道已披露题目,并非整场试卷的完整复原。AI Coding 题因缺少可靠、完整题面,本文未作任何补全或推测。