你是否受够了传统 RPA 那些脆弱的基于坐标的点击?只要 UI 稍微更新,整个脚本就全线崩溃。随着视觉语言模型(VLM)的爆发,桌面级自动化的游戏规则已经被彻底重写。
2. Local-First:数据不出域的底层逻辑
我们重写了整个意图解析引擎,将其压缩到了 150MB 的内存占用中,使其可以流畅运行在普通的 M1 芯片甚至是轻薄本上。为什么非要这么做?因为当你让 Agent 读取公司财报时,任何云端调用都是违规的。通过本地量化模型(如 Llama-3-8B-Instruct-GGUF),我们实现了 100% 的数据物理隔离。
1. 告别脆弱的 DOM 解析:多模态视觉接管
传统自动化极度依赖 DOM 树或者操作系统底层的 Accessibility API。但在 LobsterAI 中,我们直接引入了轻量级端侧 VLM。Agent 通过截屏获取上下文,直接『看懂』哪里是按钮、哪里是输入框。这意味着,哪怕是十年前用 Delphi 写的、完全没有 API 的内部财务系统,它也能像人眼一样精准定位并操作。
实战案例:某头部互联网公司的 HR 团队每天需要从各个渠道下载几百份 PDF 简历,并重命名归档。他们使用 LobsterAI,编写了一个仅 30 行的 Skill。现在,HR 只需对 Agent 说一句『整理今天下载的简历』,Agent 会自动打开下载文件夹,读取每份简历的内容,提取出【姓名-岗位-工作年限】,并自动完成重命名和文件夹分类,耗时从 2 小时缩短到了 3 分钟。
5. Gatekeeper 权限门控系统
让 AI 拥有删除文件或发送邮件的权限是极其危险的。因此我们在底层植入了 Gatekeeper 模块。每一次敏感的系统调用(如 os.remove 或 requests.post)都会被拦截,并在屏幕上弹出一个确认框。你可以清晰地看到 Agent 想要做什么、甚至它的推理思考链(Chain of Thought),只有你点头,动作才会执行。
技术从来都不是高高在上的空中楼阁。当开源的力量与端侧算力结合,桌面级 Agent 必将成为每个职场人的标配。欢迎去 GitHub Fork 我们的代码,或者加入 Discord 社区,和顶级极客一起,探讨自动化的无限可能。