经历了数月的重构与内测,今天我们非常激动地向大家宣布:LobsterAI v2.0 正式发布! 在这个大版本中,我们带来了一项革命性的更新——多模态 UI 自动化引擎 (Multimodal UI Automation Engine)。
突破 API 的限制
在过去的自动化 RPA 中,我们严重依赖软件提供的 API 接口。如果遇到一款没有 API 的内部老旧 ERP 系统,或者一个不允许接口调用的第三方网页,Agent 就束手无策了。这成为了限制桌面自动化落地的最大痛点。
让 Agent 拥有“视觉”
在 v2.0 中,我们为 LobsterAI 引入了先进的端侧视觉语言模型(VLM)。现在,Agent 可以像人类一样“看懂”屏幕上的内容。它可以识别出“确定”按钮在哪里,即便那个按钮只是一个图片;它可以读出复杂的表格结构,并自动用鼠标点击相应的单元格输入数据。
这项技术的引入,意味着 LobsterAI 不再受限于软件的底层架构。只要是人眼能在屏幕上看到、人手能用鼠标点击的东西,LobsterAI 都能替你完成。
性能提升与资源优化
尽管引入了视觉识别,但得益于我们工程团队对底层算子的深度优化,v2.0 版本的常驻内存依然控制在 150MB 以下。视觉推理过程被巧妙地切分为增量帧处理,使得即使在没有独立显卡的普通轻薄本上,依然能保持流畅的自动化操作体验。
现在就升级到 v2.0,体验真正“解放双手”的全场景办公助理吧!