
阿里巴巴刚刚开源了一个叫Page Agent的工具,它让AI大模型不再需要截屏或模拟协议,而是直接“钻进”网页内部,看懂网页结构,然后自动点击按钮、填写表单。简单说,过去开发者为了让AI操作网页,要么用截图让AI“看”,要么用底层协议强制驱动,但网页一变就失效。而Page Agent直接在网页里运行,把复杂的DOM树(网页的骨架结构)压缩成一份纯文本“地图”,AI只需要读这份地图,就能精准找到按钮、输入框,完成操作。
这个“DOM脱水”技术是核心。以前的多模态分析要截屏、处理图片,消耗大量算力,还容易漏掉关键信息。Page Agent像给AI画了一张高精度交互地图,不需要处理视觉渲染,直接拿结构说话。而且因为它内嵌在网页中,天然继承了Cookie和登录状态,开发者不用在后台处理验证码、登录流程,省了一大笔麻烦。它还能接任何支持标准接口的大语言模型,比如在SaaS产品里当智能助手、自动采集数据,甚至帮盲人用户操作网页——都变得轻巧又便宜。
当然,Page Agent不是万能的。目前它只擅长单个页面里的交互,如果涉及支付、篡改数据等高安全场景,还得靠服务器端做严格校验。不过团队已经设计了提示词触发的权限管控,给自动化流程加了道安全锁。现在这个项目已经在GitHub上以MIT协议开源,开发者可以直接下载用。这标志着AI网页自动化终于从烧钱的多模态分析,走向了轻量化、普及化的新阶段。未来,开发一个能“看懂”网页的智能体,成本可能比点外卖还低。