京东员工系列:标题优化与 Agent 面试题
京东员工系列:标题优化与 Agent 面试题
数据截止 2026 年 8 月,来源见文末。
一、标题评估
你给的这版:
京东员工:实习生、应届生结合AI写的代码一坨屎,我 Code Review的时候真是一口老血吐屏幕上,这种情况怎么办啊?(附Agent面试题)选题本身很好。AI 生成代码的质量问题是现在真实发生、几乎每个带人的老员工都遇到过的事,情绪也真实,末尾的求助句还能带动评论区讨论。这三点都对。
有三个问题需要改。
第一,得罪了你自己的核心读者。 你这个号的读者主体是学生、应届生和初级程序员,秋招和面试内容占了很大比重。标题里点名批评实习生和应届生,等于当着他们的面说他们写的代码不行。这条的转发和评论会有,但相当一部分是被冒犯之后的反弹,不是共鸣。把矛头从人转到 AI 生成的代码上,冲突感几乎不损失,读者群体反而扩大——老员工看到的是自己的处境,年轻读者看到的是「我要避免成为这样的人」,两边都能读下去。
第二,一坨屎这个词。 不至于违规,但会影响号的调性,而且微信的推荐机制对低俗表达并不友好。情绪可以保留,用词可以换。
第三,长度 60 字,偏长。 你已发布的 11 篇在 40 到 55 字之间。
二、优化版本
推荐这版,49 字:
京东员工:实习生用 AI 写的代码,一天提上来八百行,我 Code Review 到怀疑人生,这活到底怎么带(附Agent面试题)改了四处。八百行这个具体数字比一坨屎更有说服力,读者能立刻想象出画面;怀疑人生替掉一口老血,情绪在但不粗俗;矛头落在「AI 写的代码」和「一天八百行」这个量上,不是落在实习生这个人上;结尾保留求助感,评论区照样有话说。
如果你想彻底避开点名年轻人,用这版,46 字:
京东员工:现在 Code Review 一半时间在看 AI 写的代码,提交量翻了三倍,问题也翻了三倍(附Agent面试题)这版共情面最广,因为它描述的是现象不是人,任何用 AI 写代码的人看了都会点头。代价是冲突感弱一些。
如果你想把京东的业务带进标题,用这版,52 字:
京东员工:组里推 JoyCoder 之后代码量翻了三倍,我 Code Review 到怀疑人生,领导还问我为什么提效不明显(附Agent面试题)这版最贴京东,而且把矛盾升级了一层——不只是代码难看,是「AI 提效」这件事在管理层和一线之间的认知差。缺点是需要确认 JoyCoder 在京东内部的实际推广情况,别把外部产品写成全员强推。
我推荐第一版,其次第三版。
三、京东 AI 素材
集团层面(2026 年一季度)
- 收入 3157 亿元,非美国通用会计准则下归母净利润 74 亿元。
- 年度活跃用户超 7.4 亿,季度活跃用户连续 10 个季度同比双位数增长。
- 零售经营利润率 5.6%,创历史新高;服务收入同比增长 20.6%。
- 一季度研发投入同比增长 59%,这个数字可以直接用在正文里,说明京东在 AI 上是真金白银投入,也解释了为什么一线会被要求用 AI 提效。
- 官方表述是要成为全球最大的物理世界运营中心。
模型与开源
- JoyAI-LLM Flash 基础大模型
- JoyAI-Image-Edit 图像模型
- JoyAI-RA 具身大模型,官方称真机实验成功率领先
- 计划两年积累 1000 万小时视频数据,建设全链路具身智能数据基础设施
- 狼族系列机器人覆盖物流全链路
- JoyIndustrial 工业大模型,服务超万家大型企业
京东云的 AI 产品矩阵
- 京东云企业大模型服务,支持企业专属模型和垂直领域知识注入
- 言犀 AI 开发计算平台 2.0,内置 20 余种开源模型、100 余种算法工具
- 京东云大模型安全可信平台,覆盖 200 种攻击手法、31 类风险类型
- 京东云云舰 AI 算力云,支持多地域分布式算力统一调度
- 分布式存储云海 3.0,4K 随机写 IOPS 达千万级
- 言犀智能体平台,京东内部有 3300 多个活跃智能体
- 言犀数字人 3.0,支持 100 多个个性化角色、50 多个行业场景,支持双人直播、试妆、换装、实景和多语种直播
- JoyCoder 智能编程助手,支持代码预测续写、注释生成代码、智能评审,上万开发者使用,公布数据为生成代码采纳率超过 35%、研发提效 30%
写作提示:JoyCoder 的采纳率 35% 和提效 30% 是这篇文章的核心数据。标题说的是 AI 写的代码难以 Review,官方说的是提效 30%,这两个数字放在一起就是整篇最有张力的地方——采纳率 35% 意味着另外 65% 被丢掉了,而这 65% 的筛选成本,落在了 Code Review 的人身上。这个角度比单纯吐槽有价值得多,建议作为正文的主线。
京东内部 3300 多个活跃智能体
这个数字也值得展开。它说明京东的 Agent 已经不是试点,而是规模化铺开了。规模化之后的问题是治理:谁在建、建了多少、调用了多少 Token、权限边界在哪、重复建设怎么办。面试题里第 5 题和第 12 题就是从这里出的。
四、Agent 面试题(12 题 + 1 道场景题)
前四题围绕 AI Coding 和代码质量,和标题直接呼应;后面转向京东的业务场景。
01、AI 生成的代码越来越多,人工 Review 抓不过来,怎么用 Agent 做第一道关?
答题要点:把 Review 拆成机器能确定判定的部分和必须人判断的部分。前者包括规范、空指针、资源未释放、SQL 注入、事务边界、日志缺失,这些用静态分析加规则就能覆盖,不需要模型。模型真正该做的是三件静态分析做不了的事:判断这段改动是否符合提交信息声明的意图、识别与项目已有实现重复的逻辑、发现跨文件的隐含依赖被破坏。设计上让 Agent 输出带置信度的分级意见,高置信度的直接拦截在 CI,低置信度的作为提示交给人,不要让 Agent 直接给通过或不通过的结论。评价这套系统的指标不是发现了多少问题,而是人工 Review 的时间降了多少、漏网的线上故障有没有减少。
02、怎么评估一个 Coding Agent 的效果?采纳率超过 35% 这个指标够不够?
答题要点:采纳率是必要但远远不够的指标,它只衡量代码被接受进编辑器,不衡量后续命运。更完整的指标体系分三层:接受层看采纳率和补全触发率;留存层看采纳的代码在一周后、一个月后还有多少留在仓库里,被大量回滚说明当时只是顺手接受了;质量层看采纳代码的缺陷密度、评审返工次数、关联线上问题数。还要注意采纳率有天花板效应和被操纵的风险,比如把补全长度做短,采纳率自然上升但价值下降。真正的北极星指标应该是任务级的,比如一个需求从开始到合并的周期时间。
03、Agent 要改公司内部的老系统,怎么让它理解私有框架和内部规范?
答题要点:三条路径按成本从低到高。第一是上下文注入,把编码规范、框架用法、领域词表整理成结构化文档,在 Agent 的系统层常驻,这也是 Skills 机制适合承载的东西。第二是检索,让 Agent 在改动前先检索仓库里的同类实现,把内部约定当作范例给到模型,比抽象的规则描述有效得多。第三是微调,只在前两条都不够、且有足够高质量内部代码语料时才做。工程上最容易被忽略的是负样本,也就是明确告诉 Agent 哪些写法在本公司是禁止的,正面规范容易写,禁止清单往往才是老系统里踩坑最多的地方。
04、Agent 改完代码,怎么保证没有破坏已有功能?
答题要点:核心是让验证成为 Agent 循环的一部分,而不是交付之后的事。Agent 修改后必须自己跑一遍相关测试,测试失败则继续迭代,这是 Harness 层要提供的能力。测试范围的选择很关键,全量跑太慢,需要根据改动的文件和调用关系做影响面分析,选出受影响的测试子集。对于测试覆盖率本身就低的老系统,可以让 Agent 先补测试再改代码,用改动前的行为作为基线。还要有一条硬规则:Agent 不能修改测试用例来让测试通过,这是最常见的作弊路径,需要在流程上禁止。
05、内部有三千多个智能体在跑,怎么做统一治理?
答题要点:治理分四个维度。注册与发现,所有智能体统一登记能力描述和负责人,避免同一个需求在三个部门被重复建三遍。权限,智能体访问数据和调用工具的权限必须继承创建者的权限而不是平台的超级权限,否则会出现越权。成本,按智能体维度统计 Token 消耗,异常增长要能定位到具体的智能体和调用方。生命周期,长期无调用的智能体要下线,否则平台会积累大量僵尸配置。另外要有统一的工具层,让三千个智能体共享同一套工具定义,而不是各自封装一遍同样的接口。
06、售后客服 Agent 涉及退款和赔付,权限边界怎么设计?
答题要点:把动作按金额和可逆性分档。查询类无限制;小额且可逆的动作(补发优惠券、延长收货时间)允许 Agent 自主决策,但要有单用户和单日的总额上限;涉及真实资金流出的退款和赔付,Agent 只能生成建议和依据,由规则引擎或人工做最终决策。关键设计是把决策权和执行权分离,Agent 负责理解诉求、检索政策、组织证据,执行由独立的业务系统按确定性规则完成。还要防御用户侧的诱导,用户可能通过话术让 Agent 承诺超出政策的赔付,需要在输出侧做承诺类语句的拦截,Agent 说出口的话在客服场景里是有法律效力的。
07、大促备货预测,Agent 给出的建议怎么让采购敢用?
答题要点:这类场景的核心矛盾不是准确率,是可解释性和责任归属。业务人员不会因为模型说进两万件就进两万件。设计上要让 Agent 输出的不是一个数字,而是一份可审阅的推理链:参考了哪些历史同期数据、哪些相似商品、考虑了哪些促销因素、置信区间是多少、最坏情况的库存积压是多少。其次是给出可调节的旋钮,让采购能说保守一点或激进一点,而不是只能接受或拒绝。最后是建立回溯机制,每个建议事后都要复盘实际结果,形成可查的准确率档案,信任是靠这个积累的,不是靠一次说服。
08、物流调度实时性要求很高,大模型应该在哪一层介入?
答题要点:不介入实时决策环。路径规划、分单、装载这类问题有成熟的运筹优化算法,求解速度和最优性都远好于大模型,而且要求确定性和可复现。大模型该介入的是三个地方:一是把业务人员的自然语言约束翻译成优化模型的参数和约束条件,降低调参门槛;二是异常处理,当出现算法没有预设的突发情况(封路、极端天气、客户临时改约),由 Agent 收集信息、提出几种处置方案供人选择;三是事后归因,解释为什么某一天的时效指标掉了。判断标准是延迟预算和是否要求可复现,实时且要求可复现的环节不要放模型。
09、仓储机器人和具身智能场景里,大模型承担什么角色?
答题要点:分层理解。底层的运动控制、避障、抓取的力控由传统控制算法和专用小模型完成,要求毫秒级响应和高可靠。大模型在上层做任务理解和任务分解,把「把这一批退货商品按品类分拣到对应货架」翻译成一系列机器人能执行的原子动作,并在执行失败时重新规划。中间需要一层能力抽象,把机器人的动作能力封装成模型可调用的工具接口。关键难点在于失败恢复,物理世界的失败不像软件可以重试,抓空了、掉了、卡住了都需要不同的处置,这部分的策略设计比任务分解更难。数据侧的挑战是真机数据获取成本高,所以才有大规模视频数据积累和仿真训练的必要。
10、几亿 SKU 的商品知识,Agent 怎么做检索?
答题要点:纯向量检索在这个量级和这类数据上效果不好,因为商品查询里包含大量精确约束(品牌、型号、尺寸、价格区间、是否支持某项服务),这些是结构化条件不是语义相似。正确做法是让 Agent 把用户意图解析成结构化查询加语义查询两部分,结构化部分走搜索引擎的过滤,语义部分做召回,再做融合排序。商品知识本身要建成知识图谱或属性库而不是纯文本切片,因为属性之间有明确关系(兼容、替代、配件)。另外商品数据变化快,价格和库存必须实时查询,绝对不能进向量库,这是这类场景和普通文档 RAG 最大的区别。
11、数字人直播的实时互动,延迟和话术合规怎么控?
答题要点:延迟侧和车机场景类似但要求更高,因为直播是连续的,不能有停顿。做法是把话术分成预生成和实时生成两类,商品介绍、卖点讲解这些可以提前生成并缓存,弹幕互动才需要实时。实时部分做流式生成加流式合成,同时准备兜底话术,超时立刻切换到通用回应而不是卡住。合规侧的风险更大,直播话术涉及广告法的绝对化用语、价格承诺、功效宣称,必须在输出前经过一层确定性的合规过滤,这层不能用模型做判断,要用规则加词表。还要有人工接管通道,出现异常时能立刻切断。
12、几千个智能体跑在一个平台上,成本怎么算和分摊?
答题要点:先解决可观测,每一次模型调用要能关联到智能体、调用方、业务场景三个维度,这是分摊的前提。分摊模型通常按调用方所属的业务线计费,而不是按智能体的创建者,否则平台方会承担所有成本。优化手段分三层:调用层做缓存和去重,相同输入的重复调用直接返回缓存;模型层做分级路由,简单任务走小模型;提示词层做压缩,很多智能体的系统提示词冗长且包含大量不会被用到的工具定义,按需加载工具能显著降低输入 Token。治理上要设预算告警,单个智能体的消耗超过阈值时自动限流并通知负责人,避免一个循环调用的 Bug 烧掉整月预算。
场景题:如果让你设计一个帮助 Code Review 的 Agent,怎么落地?
答题要点:这题呼应标题,适合放在最后。分四步说。第一步定位,明确这个 Agent 是辅助人还是替代人,答案是辅助,目标是把人的注意力从机械检查转移到设计和逻辑上。第二步是输入,Agent 需要的不只是 diff,还需要提交信息、关联的需求描述、被改动函数的调用方、项目的编码规范,上下文不全是这类工具效果差的主要原因。第三步是输出设计,按严重程度分级,必须修改的和建议关注的要分开,并且每条意见都要给出定位和修改建议,只说有问题不说怎么改的意见会被开发者忽略。第四步是闭环,记录每条意见被采纳还是被忽略,忽略率高的规则要下线,否则开发者会逐渐把整个工具当噪音屏蔽掉。能讲到第四步的候选人,说明真的落地过。
五、正文结构建议
- 开头贴员工原声。
- 接一段现象描述:AI 让代码产出量上去了,Review 的工作量同步上去了,但考核只看提效不看 Review 成本。
- 抛出核心数据:JoyCoder 公布的采纳率超过 35%、研发提效 30%。指出另外那 65% 的筛选成本落在了谁身上,这是整篇最有价值的观点。
- 展开京东的 AI 布局:研发投入同比增长 59%、内部 3300 多个活跃智能体、言犀智能体平台和数字人、具身智能和物流机器人。说明京东是真的在大规模用 AI,一线的压力从何而来。
- 转到 Agent 面试题。
- 结尾给出建设性的答案,回应标题里的这活到底怎么带:与其人肉扛,不如把 Review 的机械部分交给 Agent,把人的时间留给设计判断。这也和场景题呼应。
六、发布前核验
来源
- 腾讯新闻 京东集团 2026 年一季度业绩:https://news.qq.com/rain/a/20260512A07Y7I00
- 东方财富 京东 2026 年 Q1 财报,研发投入同比增长 59%:https://caifuhao.eastmoney.com/news/20260513225234826054670
- IT之家 京东云八大 AI 产品发布:https://www.ithome.com/0/785/201.htm
- 新浪财经 AI 要成京东的新大腿了:https://finance.sina.com.cn/stock/relnews/hk/2026-05-12/doc-inhxsief4986483.shtml
- 新浪财经 走出算力内卷,京东用 AI 重新定义供应链价值:https://finance.sina.com.cn/wm/2026-05-14/doc-inhxvyek8723815.shtml
