把浏览器操作录成Skill,豆包工作太夯了!
大家好,我是二哥呀。
发现一个特别牛的 Skill,能直接把你操作浏览器的整个流程录成一个 Skill,然后用这个 Skill 回放你之前所有的浏览器操作。
体验拉到满中满,尤其是遇到一些重复性的操作,或者你描述不清楚的操作,直接演示一遍。简直不要太好用。
不废话,直接上最后的成果。
【录屏1】
看到了吧,豆包工作直接打开浏览器,找到对应的视频,翻到评论区,再把评论插入到飞书多维表格。
一气呵成。
01、豆包工作实操
下面给大家演示具体的操作步骤,按照我的步骤来,你也可以把一些重复性的浏览器操作通过录屏的形式制作成新的Skill,从而提高工作和学习效率。
比如说发布视频、投简历、发周报、采集竞品数据等等。
第一步,打开豆包工作,选择【浏览器录制与回放】这个skill。输入提示词。
我要收集一波王二讲 Agent 的视频评论,看看大家对什么话题感兴趣,哪些评论还没有回复,已经回复的有哪些,完成后你帮我把这些按照视频主题分类,保存到飞书多维表格里。

第二步,等豆包工作告诉你准备工作完成,录制已开始,回复【完成】就可以操作【豆包工作浏览器】按照你平常的操作流程开始了。

注意看下面这张截图,此时豆包工作已经帮我们准备好了一个豆包工作浏览器,头部会显示一个【豆包浏览器自动化助手】已开始调试此浏览器。

等你操作完成后,豆包工作会对本次操作进行一个总结说明。

操作流程也会详细地记录下来。

中间有任何需要调整的,都可以进行调整。比如说一次性统计所有视频太多,我们只收集昨天发布视频的所有评论。

第三步,如果你确认没问题就可以回复一个【确认】,此时豆包工作就会把这次任务制作成一个新的 Skill。

新的Skills制作完成。

调用方法就和之前你操作任何一个Skills一样。

我们还可以对这个Skills进行补充,比如说让他把视频的评论插入到飞书文档。
通过豆包工作已集成的飞书文档连接器,把已采集评论按 “视频主分类→视频标题→评论及对应作者回复” 真正写入飞书。找不到则创建《王二讲 Agent|视频评论分类汇总》。视频主分类查本地视频稿 / 题库或抖音合集;若仅按内容归类,明确标注 “按视频主题归类,抖音合集未核实”。

点击链接打开飞书文档,就可以看到评论已经采集完成了。

02、飞书多维表格
如果觉得飞书文档不过瘾,还可以把数据插入到多维表格。
请直接继续在豆包工作中使用已集成的飞书能力完成,不要再将普通文档作为最终交付。原文档保留,不删除。创建《王二讲 Agent|视频评论管理》多维表格(如果本任务已有对应表则增量更新),读取已核验的 exported-isolated-result.json。建议一张评论表,每条主评论一行。

第四步,好,所有的流程搞定后,我们就可以用新的Skills来回放了。

直接调用我刚安装并选中的 Skill,采集这条视频的评论。正常浏览几屏评论,再在同一个豆包工作浏览器窗口打开按分类分组视图展示结果。沿用现有配置,不改脚本,不做逐条精确控制,直接完成整套流程。

看,我们再采集新的视频评论时,速度就非常快了。

很快搞定,还会把数据同步给我们:
- 该视频已有 21 条主评论记录 归档在《王二讲 Agent|视频评论管理》中,按视频 ID + 评论 ID 去重,本次无重复新增
- Base 总记录数:31 条(视频 1:5 + 视频 2:2 + 视频 3:3 + 视频 4:21)
- 分类:Agent 基础与面试 / 鹅厂 Agent 面试题手搓 Agent vs LangChain
- (21 条主评论,含 10 条已回复、11 条未回复,27 条嵌套回复)
之所以快,是因为之前的流程我们已经让【浏览器录制与回放】Skill 帮我们固化了,换到新的 Skills 就不需要再去摸索,找各种 DOM 组件。
对吧?

这就非常爽了。
做过内容的小伙伴都知道,评论是最真实的用户反馈。观众在评论区问的问题、吐的槽、表达的期待,比任何数据面板都直观。
我做「王二讲 Agent」这个系列有一段时间了,每期视频发出去之后,评论区是我最关注的地方。哪些话题观众讨论最多,哪些知识点大家觉得不够清楚,下一期该讲什么,答案全在评论里。
但问题是,评论多了之后,手动去翻真的很费劲。尤其是多个视频的评论混在一起,哪些回复了,哪些还没回复,手动去统计可要了老命。
有了这个 Skill,直接调用一下就能把最新的评论采集到飞书多维表格里。已回复、未回复、高频话题,全部自动分类,一目了然。

甚至有了待回复的评论,我还可以让豆包工作帮我定位到具体那条评论,直接回复。那是相当的便捷。
对于做自媒体、做电商、做社群运营的小伙伴来说,思路是一样的。把平台上的用户反馈批量采集下来,整理成结构化的数据,比一条条翻省太多时间了。
03、录制回放的原理
可能有小伙伴会好奇,豆包工作是怎么把我们在浏览器中的操作学会的?

先说传统的 RPA(Robotic Process Automation,流程自动化)工具。它录的是鼠标坐标和键盘输入,你点了屏幕上 (350, 200) 这个位置,它就记一条「点击 (350, 200)」。网页改个版,按钮挪个位置,脚本就废了。这也是 RPA 被吐槽最多的问题,维护成本太高。
豆包工作的录制回放走的是另一条路,用的是 AI + 浏览器自动化的组合。

录制的时候,豆包工作浏览器会通过调试协议获取页面的 DOM 结构,AI 同步分析你每一步操作对应的页面元素和上下文。你在标题栏填了商品名称,AI 记住的是「在标题输入框里填写内容」这个语义级别的动作,而不是一个死坐标。
生成 Skill 的时候,AI 会把你演示的操作序列翻译成一套带条件判断的执行流程,包含元素定位策略、输入参数模板和异常处理逻辑。回放的时候,AI 会根据当前页面的实际 DOM 重新定位目标元素,而不是死记上次的位置。所以页面布局稍微变一变,按钮换个位置,Skill 照样能跑。

换句话说,豆包工作的【浏览器录制与回放】录的是操作意图,不是像素坐标。
有一点需要注意,目前豆包工作的录制回放只支持在自带的浏览器里操作,Chrome 和本地应用暂时还录不了。官方说后续会扩展到全电脑端,到时候不光是网页,桌面应用的重复流程也能录。
超期待。
ending
这个功能最打动我的一点,它把自动化的门槛从「会写代码」延伸到了「会操作电脑」。
不需要学 Python,不需要研究 Selenium,不需要看 RPA 平台的文档。做一遍你每天都在做的事情,剩下的交给豆包工作就 OK 了。
我自己用下来,最大的感受就是省心。以前想搞自动化,光是配环境、写脚本就得折腾半天。现在操作一遍,Skill 就生成了。
网页搜索「豆包工作」就能下载电脑端,新用户可以免费领 30 天订阅权益,够你把手头的重复流程都跑一遍了。
https://www.doubao.com/work

我们下期见。
