宇树科技员工系列:素材包与 Agent 面试题
宇树科技员工系列:素材包与 Agent 面试题
数据截止 2026 年 8 月 10 日,来源见文末。宇树正处于发行上市窗口期,发布前请核对最新公告。
一、标题评估
宇树科技员工:入职五年了,薪资一共涨了 58%,主要是入职时的基数太低了,不过现在很知足了(附Agent面试题)可以用,44 字,长度正好在你的区间里,口语自然,没有编造痕迹。
逻辑上完全自洽,这一点值得说明:宇树成立于 2016 年,五年前也就是 2021 年入职,那时候公司主力产品还是卖给科研院所的四足机器人,2023 年全年营收才 1.59 亿元,给不起高薪,「入职时基数太低」是真实成立的。而 2025 年营收已经 17.08 亿元,同比增长 335%。一个人在公司营收翻了十倍的五年里薪资只涨 58%,这个反差就是整篇文章的引擎。
唯一可以商榷的是,标题把最强的钩子留在了正文。宇树这几天正在发行上市,8 月 6 日已经公告发行价 150.80 元、发行市值 609.93 亿元,这是本周科技圈热度最高的事。标题不提,读者点进来之前不知道这是一篇有时效性的文章。
如果你想把钩子前置,用这版,45 字:
宇树科技员工:入职五年薪资一共涨了58%,基数太低是主要原因,不过公司要上市了,现在很知足(附Agent面试题)只多了六个字,「很知足」三个字的分量完全不同了。写「要上市了」而不是「上市了」,因为截至目前只公告了发行价和路演安排,具体上市日以交易所公告为准。
两版都能用。原版胜在朴素,反差在正文里揭开,阅读快感更强;加强版胜在标题就有信息量。我推荐加强版,因为公众号的竞争在列表页,不在正文里。
二、核心素材
上市与发行
- 8 月 6 日公告发行价 150.80 元/股,发行市值 609.93 亿元,A 股人形机器人第一股。
- 预计募集资金总额 60.99 亿元,净额 59.17 亿元,募投项目 42.02 亿元。
- 8 月 7 日网上路演,随后进入申购流程。
- 社保基金为第一大战略配售方,合计获配约 93.34 万股。
- DeepSeek 以 1.41 亿元获配约 93 万股,锁定期 36 个月。腾讯等其他战投锁定 12 个月。DeepSeek 用 36 个月的锁定期和三倍于常规的承诺,把大模型和具身智能的合作绑在了一起,这是这次发行里最值得写的一条信息。
员工持股(这是整篇文章的情绪核心)
- 1 号员工持股资管计划:161 名中层骨干参与,认购金额约 2.185 亿元,人均约 135 万元,锁定期 12 个月。
- 2 号员工持股资管计划:10 名核心层参与,认购金额 5300 万元,锁定期 36 个月。创始人王兴兴认购 1500 万元,另有三名核心成员各认购 900 万元。
- 董监高还受 25% 的年度减持比例限制,实际变现周期更长。
写作提示:这一段必须写准,否则会被懂行的读者纠正。员工持股是自己掏钱认购,不是公司白送,人均 135 万元是真金白银的投入,而且要锁 12 个月甚至 36 个月。所以标题里那句「现在很知足」不是躺赢的知足,是一个五年只涨 58% 薪资的人,拿出上百万认购自家股票、还要再等一年才能动的那种知足。这个层次感比单纯的「一夜暴富」故事有价值得多,也更真实。
业务与财务
- 营收:2023 年 1.59 亿元,2024 年 3.93 亿元,2025 年 17.08 亿元,同比增长 335.36%,三年复合增长率 226.78%。
- 利润:2025 年扣非净利润 6.00 亿元,同比增长 674.29%;2023 年还亏损 1801.91 万元。经营活动现金流 6.72 亿元。
- 毛利率:主营业务 60.27%,其中四足机器人 55.49%,人形机器人 62.91%。
- 收入结构(2025 年 1 至 9 月):人形机器人 5.95 亿元占 51.53%,四足机器人 4.88 亿元占 48.47%。人形首次超过四足成为第一大收入来源。
- 出货量:四足机器人累计销量超 3 万台;人形机器人 2023 年 H1 全年卖 5 台,2024 年 G1 全年 410 台,2025 年出货超 5500 台,全球第一。
一个必须写进去的冷静视角
人形机器人的客户结构(2025 年 1 至 9 月)是:科研教育 73.60%,商业消费 17.39%,行业应用 9.01%。而在那 9.01% 的行业应用里,企业导览又占了 50% 到 70%,真正的工业应用只占 29.29%。
也就是说,卖得最好的人形机器人,绝大部分买家是高校和实验室,剩下的多数在做展厅接待。这个行业距离真正的规模化产业落地还很远。
这一段是整篇文章从「造富故事」升华成「行业观察」的关键。它也回答了标题里那个隐含的问题:为什么在一家营收三年翻十倍的公司里,一个五年老员工的薪资只涨了 58%——因为这个行业还在早期,收入结构还没有跑通,公司把钱压在了研发上。
研发投入与技术方向
- 募资 42.02 亿元的用途中,智能机器人模型研发项目占 20.22 亿元,比例 48.13%;机器人本体研发 11.10 亿元;新型产品开发 4.45 亿元;制造基地建设 6.24 亿元。研发相关投入占募资的 85.15%。
- 2025 年 9 月,宇树开源了 UnifoLM-WMA-0 世界模型架构,包含两个模块:一是仿真引擎,作为交互式模拟器为机器人学习提供合成数据;二是策略增强,与动作头对接,通过预测未来的交互过程来优化决策性能。该架构面向跨本体的通用机器人学习设计,能够预测未来动作视频,可完成叠木块、整理文具、放置物体这类操作任务。
- 公开报道显示宇树在双轨推进 WMA(世界模型动作)与 VLA(视觉语言动作)两条大模型路线。
写作提示:这一段是从「机器人公司」接到「AI Agent」的桥。宇树把近一半募资投向模型研发,说明它的自我定位已经从卖硬件转向了造大脑。加上 DeepSeek 的战略配售,大模型和机器人本体的结合就是这篇文章落到面试题的自然通道。
三、Agent 面试题(12 题 + 1 道场景题)
具身智能方向,和宇树的业务直接相关。
01、具身智能里,大模型和传统控制算法应该怎么分层?
答题要点:分三层来看。底层是实时控制,包括平衡、步态、力控、避障,要求毫秒级响应和确定性,由传统控制算法和专用小模型承担,大模型绝对不能进这一层。中间层是技能库,把「抓取」「放置」「行走到某处」封装成参数化的原子动作,这一层可以是学习出来的策略,也可以是编程实现的。最上层是任务理解与规划,由大模型把人的自然语言指令翻译成技能序列,并在执行失败时重新规划。判断某个功能该放哪一层的标准是延迟要求和失败代价,延迟要求越严、失败代价越不可逆,越要往下沉、越要用确定性方法。
02、世界模型和 VLA 是两条什么样的路线?各自解决什么问题?
答题要点:VLA 是端到端路线,输入视觉和语言,直接输出动作,优点是链路短、不需要显式建模环境,缺点是需要海量真机数据,且行为不可解释、失败时难以定位。世界模型路线是让模型先学会预测「如果我做这个动作,环境会变成什么样」,再基于预测做决策,优点是可以用预测能力生成合成数据来缓解真机数据不足,也能在动作执行前做内部推演从而减少试错,缺点是预测误差会累积,长时序预测容易失真。两条路线不是互斥的,实践中常见的做法是用世界模型做仿真和数据生成,同时用它的预测能力去增强 VLA 的策略,这也是把两者结合的典型思路。
03、真机数据成本这么高,仿真到真机的差距怎么补?
答题要点:差距来自三方面,物理参数不准(摩擦、质量分布、电机响应)、视觉渲染不真实、以及仿真里没有的意外情况。对应的手段:域随机化,在仿真中随机化物理参数和视觉外观,逼迫策略学到对参数不敏感的行为;真机数据做微调,仿真训练打底,少量真机数据做最后对齐;系统辨识,用真机数据反过来校准仿真器的参数。评估上要注意仿真里的成功率和真机成功率往往差距很大,只报仿真指标是没有说服力的。近年比较有效的思路是用真实交互视频训练世界模型,再用世界模型当仿真器,这样生成的数据在物理规律上更接近真实。
04、遥操作采集的数据为什么值钱?怎么保证质量?
答题要点:遥操作数据的价值在于它是「带正确动作标签的真实交互数据」,这是互联网视频给不了的——网上有大量人做家务的视频,但没有对应的关节角度和力矩序列。质量控制有几个关键点:操作者的动作要平滑且符合机器人的运动学约束,人手的习惯动作机器人未必能复现;要覆盖失败和恢复的过程,只采集成功轨迹会导致策略遇到偏差就无法纠正;要记录多视角和本体感知信号,不能只有主视角图像;要做数据清洗,剔除操作者犹豫、误操作、中途暂停的片段。另外要注意采集场景的多样性,同一个房间采一万条的价值远低于一百个房间各采一百条。
05、机器人任务执行失败了怎么恢复?和软件 Agent 的重试有什么本质不同?
答题要点:软件 Agent 的重试通常是幂等的,失败了再调一次接口,世界状态没变。物理世界不是——抓空了物体可能被碰倒,倒水倒洒了液体已经在桌上,重试的前提是先恢复到一个可重试的状态。所以具身 Agent 的失败处理必须包含三步:检测(通过力反馈、视觉验证判断动作是否真的完成,而不是相信控制指令已下发就等于成功)、评估(当前状态与预期状态的偏差有多大,是否还在可恢复范围内)、恢复(先执行一个复位动作回到已知状态,再重新规划)。工程上最容易忽略的是检测这一环,很多系统默认动作执行成功,导致错误一路累积。
06、把「整理这个货架」这类长时序任务分解成机器人能执行的动作,难点在哪?
答题要点:难点不在于分解本身,大模型做任务分解已经比较可靠,难点在于分解结果的可执行性和状态跟踪。可执行性是指模型分解出的步骤必须落在机器人的技能库里,模型不知道机器人不会做什么,所以要把技能库作为工具描述给到模型,并约束它只能使用列表内的动作。状态跟踪是指长任务执行过程中环境在变化,第三步的前提可能在第二步执行后已经不成立,所以不能一次性规划完就闭眼执行,需要边执行边校验前提条件。另外要设计中断和续接,长任务被打断后要能从中间状态继续,而不是从头开始。
07、机器人的多模态感知怎么接进 Agent 的上下文?
答题要点:不能把原始图像流直接塞进上下文,一是 Token 消耗巨大,二是模型对连续帧的冗余信息利用率很低。正确做法是分层抽象:感知模块把原始信号处理成结构化的场景描述,比如物体列表、位置、姿态、可抓取性,Agent 消费的是这份描述而不是像素。需要视觉细节时再按需请求特定视角的关键帧,把「看一眼」设计成一个工具调用。本体感知信号(关节角度、力矩、电池、温度)作为状态信息定期注入,但要做变化检测,只在显著变化时更新。这样设计的另一个好处是感知模块可以独立升级,不影响上层的任务逻辑。
08、端侧算力有限,大模型怎么部署到机器人本体上?
答题要点:按频率和延迟要求切分。高频低延迟的控制环必须在本体,通常运行在专用芯片上,模型规模很小。任务规划这类低频高算力的部分可以放云端,因为规划一次可以执行几十秒。中间的感知理解通常放本体的边缘计算模块,用量化后的中等规模模型。切分的核心约束是断网可用性,机器人在断网时必须能安全停下并保持已有任务的完成度,不能因为云端不可达就失控。另外要考虑功耗,机器人是电池供电,算力和续航是直接矛盾的,这一点和服务器场景完全不同。
09、物理世界的动作不可逆,机器人 Agent 的安全边界怎么设计?
答题要点:安全不能依赖模型的判断,必须有独立的、确定性的安全层。设计上分三道:第一道是物理限制,力矩上限、速度上限、工作空间边界由硬件和底层固件强制执行,任何上层指令都无法突破。第二道是动作白名单和前置校验,Agent 提出的动作在下发前由安全模块校验,比如靠近人时禁止高速运动。第三道是人在回路,涉及人身安全和高价值物品的动作需要人确认。还要有紧急停止的独立通道,不经过任何软件栈。回答这题的关键是能说清「安全层必须独立于 Agent,且是确定性的」,把安全判断交给大模型是最大的设计错误。
10、怎么评测一个具身 Agent?成功率之外还要看什么?
答题要点:成功率是最粗的指标,且容易被任务难度的选择操纵。更完整的评测要看几个维度:泛化性,换一个没见过的场景、换一个同类但外观不同的物体,成功率掉多少;鲁棒性,在执行中人为施加扰动(挪动物体、遮挡视线),能否恢复;效率,完成任务的时间和动作数,绕了很多弯路的成功和干净利落的成功价值不同;安全性,过程中有没有发生碰撞、超力矩、危险接近。评测的组织方式上,要区分仿真评测和真机评测,真机评测成本高但不可替代,通常做法是仿真跑大规模回归,真机跑小规模的关键场景集。还要注意评测集必须和训练场景严格隔离。
11、一个仓库里几十台机器人,多个 Agent 怎么协同?
答题要点:分层协同。全局层做任务分配和资源调度,这一层用运筹优化而不是大模型,因为要求最优性和确定性。个体层每台机器人有自己的执行 Agent,负责本地感知和动作执行。冲突解决放在中间层,比如通道占用、充电桩争抢,用预约机制或者集中式仲裁,不要让机器人之间自由协商,那样收敛慢且不可预测。大模型在这个体系里主要做两件事:把人的调度意图翻译成优化目标,以及在出现规则没覆盖的异常时提出处置方案。要强调的是,多机协同的难点是通信延迟和状态不一致,设计时要假设每台机器人看到的全局状态都是过期的。
12、机器人的记忆怎么设计?和对话 Agent 的记忆有什么不同?
答题要点:对话 Agent 的记忆主要是语义和事件,机器人多了一个关键维度——空间。需要三类记忆:空间记忆,环境地图、物体的位置和状态,这类记忆要能持续更新,因为物体会被移动;任务记忆,正在执行的任务的进度和中间状态,用于中断后恢复;经验记忆,某个抓取姿势在这个物体上失败过,下次换一种,这类记忆直接影响策略选择。三者的更新频率和存储方式都不同:空间记忆需要几何结构而不是文本,通常存在场景图或地图里;任务记忆是短期的,随任务结束而归档;经验记忆是长期的,需要做泛化,不能只记住具体实例。另外物理世界的记忆有个特殊问题——过期,你记得杯子在桌上,但别人拿走了,所以取用记忆前要做验证。
场景题:给一台人形机器人设计「把桌上的东西收拾好」这个任务的 Agent,你会怎么落地?
答题要点:这题可以放最后,也最能看出候选人有没有想过真实问题。分五步说。第一步是任务澄清,「收拾好」是模糊指令,需要 Agent 主动确认或者用常识补全,垃圾扔掉、书本归位、餐具送厨房,这套映射从哪来是第一个设计决策。第二步是场景理解,识别桌上的物体、判断每个物体的类别和归属位置,这里要处理未知物体,遇到不认识的东西是跳过还是询问。第三步是排序,先拿什么后拿什么会影响成功率,比如先移走挡住其他物体的大件。第四步是执行与验证,每个动作后验证是否真的完成,抓取失败要重试并在多次失败后放弃并记录。第五步是收尾汇报,告诉用户完成了什么、有哪些没做以及原因。加分项是能主动提到安全边界,比如遇到易碎品或者不确定的物品应该询问而不是自作主张,以及提到这个任务的评测应该怎么设计。
四、正文结构建议
- 开头贴员工原声。
- 立刻给出反差:这个人所在的公司,2023 年营收 1.59 亿元,2025 年 17.08 亿元,三年翻了十倍,本周发行价定在 150.80 元,发行市值 609.93 亿元。
- 讲员工持股:161 名中层骨干人均认购约 135 万元,锁定 12 个月;10 名核心层锁定 36 个月。说清楚这是自己掏钱认购,不是白送。这一段把「知足」两个字的分量做实。
- 泼一盆冷水,也是全篇最有价值的部分:人形机器人 73.60% 的客户是科研教育,行业应用只占 9.01%,其中还有大半在做展厅导览。这个行业离规模化落地还远,公司把钱都压在研发上,所以老员工的薪资涨得慢。这不是公司抠门,是行业阶段决定的。
- 转技术:42.02 亿元募投里近一半投向模型研发,2025 年 9 月开源 UnifoLM-WMA-0 世界模型,双轨推进 WMA 和 VLA。加上 DeepSeek 以 1.41 亿元战略配售并锁定 36 个月,大模型和机器人本体正在往一起走。
- 转到 Agent 面试题。
- 结尾回到那个五年只涨 58% 的人:他等的不是这次上市,是这个行业真正跑通的那一天。
五、发布前核验
来源
- 新浪财经 宇树科技 IPO 定价 150.80 元,发行市值近 610 亿元:https://finance.sina.com.cn/esg/2026-08-06/doc-inimmayv4469097.shtml
- 北京商报 宇树科技发行市值 609.93 亿元:https://www.bbtnews.com.cn/2026/0806/601498.shtml
- 新浪财经 宇树科技 IPO 造富:161 名员工持股安排:https://k.sina.com.cn/article_7879922977_1d5ae152106801i0iy.html
- 21 财经 宇树科技超百名员工参与 IPO:https://m.21jingji.com/article/20260806/herald/598013f30b6a88c4f56855d8abd98516.html
- 经济观察网 深度拆解宇树科技招股书:https://www.eeo.com.cn/2026/0320/813654.shtml
- 新华网 宇树科技通过科创板上市审核:https://www.news.cn/fortune/20260601/c6a6d3341daa43dcab1668fc816f88d5/c.html
- 新浪科技 宇树开源 UnifoLM-WMA-0 世界模型架构:https://finance.sina.com.cn/tech/digi/2025-09-15/doc-infqqunc4408005.shtml
- 量子位 宇树开源机器人世界大模型:https://www.qbitai.com/2025/09/332582.html
