宇树员工:入职五年了,薪资一共涨了 58%,主要是入职时的基数太低了,不过现在已经很知足了(附Agent面试题)
对于很多老员工来说,你入职的时间越久,就意味着你入职时的基本工资越低。
所以经常会出现薪资倒挂的情况。
但如果一家公司注重老员工的体验时,就会通过普调啊、晋升啊,一直涨薪,好留下人才。毕竟入职时间越久,处理的事情就越多,经验上就会越丰富。
同时,公司如果还有新鲜血液加入,就会形成一个比较好的良性竞争环境。
ps:我先叠个甲,下面这些数据是我通过Codex做的深度调研,如果不准确的话,锅就让Codex来背。😄
2023年,宇树全年营收1.59亿元,2025年来到了16.99亿元,同比增长335%。人形机器人出货5511台,全球市场份额32.4%,四足机器人年销量超过2.3万台,全球市占率接近70%。

五年营收翻了十倍,说实话,能在这样的公司待着,我也很知足。另外,我调查的时候还发现,8月6日,DeepSeek 以1.41亿元获配约93万股宇树科技,锁定期36个月。双方签了一个战略合作备忘录——联合研发具身智能,DeepSeek 的具身业务优先采购宇树的机器人,宇树做大模型训练和适配的时候优先选用 DeepSeek 的方案。
DeepSeek 做的是推理能力、规划能力、语言理解,宇树做的是运动控制、核心部件、整机工程化和量产。未来很美好。

之前我们也聊过,机器人是大模型真正落地到物理世界的一个方向。
具身智能相关的岗位——VLA 算法、运动控制、仿真环境、机器人 Agent 推荐大家都去冲一冲。如果你是一位愿意相信努力、相信过程、相信一步一个脚印、相信自己能在 AI 时代分一杯羹的人,那接下来的硬核内容,希望你能认真读一读。

(全文比较肝,保证大家能学到很多很多,系好安全带,我们粗粗粗发~)
content
01、软件 Agent 和具身 Agent 最核心的区别是什么?
“软件 Agent 调用 API 操作数据,无非是软件层面的东西,具身 Agent 通过电机和执行器操作的是物理世界,硬件显然更贵,成本更高。具身 Agent 的错误成本天然也更高。”

02、VLM、VLA 和传统的“LLM+工具调用”架构有什么区别?分别适合哪些机器人任务?
“VLM 能看能说,VLA 能看能说还能动。”
VLM(Vision-Language Model,视觉语言模型)接收图像和文本输入,输出文本。它能理解场景、回答问题、做高层规划,但不能直接输出运动轨迹。适合做任务分解和场景理解——“桌上有三个杯子,红色的那个离边缘最近”。
VLA(Vision-Language-Action,视觉语言动作模型)是端到端的。输入图像加文本指令,直接输出关节角度或者末端执行器的位置和姿势。
拿宇树2026年1月开源的 UnifoLM-VLA-0 来说,在 LIBERO 基准测试上平均分98.7,能直接把“拿起红色杯子”这句话变成一条抓取轨迹。

拿“把红色杯子放到架子上”这个指令来说,VLA 可以端到端直接输出轨迹。LLM+工具调用要先解析指令,再调目标检测定位杯子,接着算路径规划的轨迹,最后交给运动控制执行。
03、为什么机器人不仅需要“大脑模型”,还需要低延迟的运动控制“小脑”?
大脑负责任务规划和决策。理解“帮我把桌子收拾干净”这句话,判断先拿什么后放什么。
小脑负责运动控制。让机器人走路时保持平衡、踩到不平的地面能立刻调整步态、抓东西时力度恰到好处。

举个例子,机器人在走路的时候踩到一块石头,脚底受力突变。如果把这个信号交给大脑的 VLA 模型来处理,推理就很慢,机器人早就失去平衡摔倒了。
小脑的运动控制器用强化学习训练,部署在端侧,短时间内就能输出关节力矩调整。
04、世界模型在具身 Agent 中承担什么作用?它与普通仿真器有什么区别?
“世界模型让机器人在动手之前,先在脑子里模拟一遍动作的后果。”

普通仿真器把重力加速度、摩擦系数、碰撞弹性这些用数学公式建模,精确但并非现实世界。现实世界里物体的变形、打滑、不规则表面这些情况,很难全部用公式描述。
世界模型是从真实数据里训练出来的。喂给它大量真实世界的视频和交互数据,让它学会“推一个杯子,杯子会往哪滑”“抬腿迈过障碍物,重心怎么变化”。
碰到训练时没见过的物体,它也能给出合理的预测,泛化能力比手写仿真器强。
世界模型怎么训练?
宇树2025年9月开源的 UnifoLM-WMA-0,用的是视频扩散模型作为基础架构。仿真引擎模块做交互式模拟,为机器人学习提供合成训练数据。策略增强模块和动作头对接,通过预测未来的交互视频来优化决策——机器人在做一个动作之前,先“想象”做完之后会发生什么。

05、如何把行走、转身、抓取、放置、充电等机器人能力封装成类似 Skill 或 Tool Calling 的工具?
“每个原子动作封装成一个独立的 Skill,带前置条件、执行逻辑和后置断言。”
拿“抓取”这个 Skill 来说。
前置条件(Preconditions):机械臂在工作范围内、目标物体已被检测到、夹爪处于张开状态。三个条件有一个不满足,这个 Skill 就不能被调用。
执行逻辑:移动到目标上方→下降到抓取高度→闭合夹爪→抬起。每一步的运动轨迹由小脑的控制器生成。
后置断言(Postconditions):力传感器检测到夹持力在合理范围内,目标物体的位置和末端执行器位置一致。如果后置断言不满足,说明抓取失败了。

组合能力通过任务图编排。“把杯子从桌子放到柜子里”拆成定位→导航→抓取→导航→放置→释放,每一步的后置断言就是下一步的前置条件。
06、如果自然语言指令是“把桌面收拾干净”,Agent 应该如何将模糊目标拆解成可执行动作?
“收拾干净是个模糊目标,Agent 要自己搞清楚‘干净’是什么意思。”
第一步,视觉感知。调用目标检测模型扫描桌面,识别每个物体的类别、位置和姿态。一个杯子、两本书、一包纸巾、一个手机充电器——先知道桌上有什么。
第二步,目标推理。根据常识判断哪些东西需要移走,哪些应该留着。台灯、显示器属于桌面固定物品。用完的餐具、零食包需要清走,VLM 需要理解“干净”在当前场景里到底是什么标准。

第三步,生成动作序列。对需要移走的物体排优先级——易碎的先拿。为每个物体生成抓取和放置的动作序列,确定放到哪里。
第四步,逐步执行加实时校验。每完成一个物体的操作,重新做一次视觉感知,确认物体确实被移走了。
执行中途失败了怎么办?
比如说抓杯子的时候没夹住,杯子滑到了桌子边缘。执行器在每个动作结束后检查后置断言。力传感器没有检测到夹持力,说明抓取失败了。
Agent 重新感知当前状态,发现杯子的位置变了。重新规划抓取策略——可能需要换个角度,或者先把杯子推到桌面中间再抓。

如果连续失败超过阈值,上报异常,请求人工介入。物理世界里不能无限重试,每一次失败都有可能让情况变得更复杂。
07、训练一个能完成工厂装配任务的 VLA 模型,需要采集哪些数据?
视觉流:多视角的 RGB 图像加深度图像。至少要有一个第三人称视角看全局,一个手眼相机视角看末端执行器正在操作的画面。

语言标注:每段操作对应的自然语言描述。标注粒度很重要——“拿起螺丝”是模糊含义,“从零件盒第二格拿起 M6 螺丝,拧到左侧面板第三个孔位”这种包含上下文的标注,模型才能学到精细的指令理解。
动作轨迹:机械臂各关节的角度、角速度、力矩,加上末端执行器的六自由度位姿和夹爪开合状态。
08、模型 OTA 升级后机器人行为发生退化,应该如何做灰度发布、回滚和版本追踪?
“金丝雀发布。新版本先推给1%的机器人,跑24到72小时。”
监控安全指标,包括跌倒率、碰撞频次、急停触发次数。同时监控性能指标,包括任务成功率、平均完成时间、动作平滑度。
版本追踪需要绑定模型权重版本、策略配置版本、硬件固件版本。同一个模型在不同固件版本的机器人上行为可能不一样,因为传感器驱动和电机参数有差异。

金丝雀通过之后逐步放量,10%→30%→100%。全量推送之后还要保持旧版本的回滚能力至少两周,出了问题能快速切回去。
09、如何设计具身 Agent 的 Memory?
短期记忆存当前任务的即时状态。正在执行“收拾桌面”,记忆里存着已经处理了3个物体,还剩2个,当前手里拿着一个杯子,目标是厨房的碗柜。

长期记忆存积累的环境知识——“垃圾桶在厨房角落”、“主人的杯子是蓝色的那个”、“客厅的地毯边缘容易绊脚”。通过多次交互逐渐积累,持久化存储,跨任务复用。
空间记忆是具身 Agent 特有的。维护一张动态的环境地图,记录房间布局、家具位置、通行路径。椅子被挪了位置,空间记忆需要更新。
10、真实机器人数据昂贵,如何结合仿真数据、合成数据和真实数据进行训练?
仿真数据在物理引擎里生成,量大、便宜、安全,可以大规模模拟各种极端场景——跌倒、碰撞、负重极限。
合成数据做域随机化(Domain Randomization),弥补视觉层面的差异。随机变换光照条件、物体纹理、背景颜色,让模型见过足够多的视觉变体之后,对这些差异不再敏感。

然后用真机采集的轨迹数据做最后一步微调,把仿真和合成数据覆盖不到的物理细节补上。
11、给一台人形机器人设计「把桌上的东西收拾好」这个任务的 Agent,你会怎么做?
给机器人装多个摄像头——头部广角摄像头看全局,手腕相机看末端执行器正在操作的区域。
用目标检测模型识别桌面上所有物体的类别、位置、尺寸,深度相机提供三维坐标。识别结果交给 VLM 做场景理解,判断哪些需要收走、哪些应该留着。

VLM 输出一个任务清单——收走用完的餐具,把书放回书架,擦掉水渍。每个子任务再拆解成原子动作序列,排列优先级,易碎的先处理。
每个原子动作走小脑的运动控制器,VLA 模型接收当前视觉输入和动作指令,输出关节轨迹。力传感器实时反馈调整夹持力。
每完成一个物体的操作,重新做一次视觉感知——物体确实被移走了吗?桌面状态在往“干净”的方向走吗?
如果抓取失败了,重新规划。任务完成后拍一张桌面全景图,和“干净”的参考状态做对比确认。

具身 Agent 怎么写到简历上?
项目名称:PaiAgent——具身Agent任务编排与仿真平台 2026.03 – 2026.06
项目简介:面向人形机器人的多 Agent 协作平台,支持多层级任务调度、原子能力封装与编排、多模态感知与反馈控制、仿真与真实数据混合训练,集成分层 Memory 管理和灰度发布能力,覆盖从自然语言指令到物理动作执行的完整交互流程。
技术栈:Java 21、Spring AI、LangGraph4j、PyTorch、Isaac Sim SDK、MCP 协议、Redis

核心职责:
- 设计多 Agent 分层调度架构,大脑层 VLM 负责自然语言指令解析和任务规划,小脑层运动控制器执行关节级动作,安全层做风险拦截和操作权限管控;按任务类型和实时性要求路由到对应 Agent,高频控制指令走端侧推理
- 基于 MCP 协议封装机器人原子能力(行走、抓取、放置、旋转),每个 Skill 带前置条件校验和后置断言验证,组合任务通过 DAG 自动编排调度;前置条件不满足时阻塞调用并上报状态,后置断言失败时触发重规划
- 设计四层 Memory 架构(工作记忆、情景记忆、语义记忆、空间记忆),工作记忆维护当前任务进度和执行器状态,情景记忆按时间窗口保留用户偏好和交互事件,语义记忆持久化存储环境知识,空间记忆维护动态环境地图并支持近邻查询
- 构建仿真-真实数据混合训练流水线,Isaac Sim 生成多场景仿真数据,域随机化弥补 Sim-to-Real 视觉差异,真实采集数据做最终微调;仿真与合成数据占训练集80%以上,真实数据做精调
- 实现模型灰度发布和版本追踪机制,通过版本注册中心管理模型权重、策略配置和硬件固件的兼容性矩阵,支持1%金丝雀发布和按安全指标自动回滚,全量推送后保持旧版本两周回滚窗口
ending
当 Agent 走向物理世界,它要应对的就不只是 token 和 API 延迟,还有重力、摩擦力、风雨雷电。
技术的边界在扩大,但“愿意动手、愿意学新东西”这件事本身,不会过时。
加油吧,兄弟姐妹们。
下期见。
