浏览器智能体(Browser Agent / Computer Use Agent)是 2025 年下半年迅速升温的一类智能体形态:让大模型直接操控浏览器,完成登录、表单填写、数据抓取、跨系统操作等任务。OpenAI 在 2025 年 10 月推出 Operator,Anthropic 在 2024 年 10 月推出 Claude Computer Use,Google 在 2025 年 12 月
浏览器智能体(Browser Agent / Computer Use Agent)是 2025 年下半年迅速升温的一类智能体形态:让大模型直接操控浏览器,完成登录、表单填写、数据抓取、跨系统操作等任务。OpenAI 在 2025 年 10 月推出 Operator,Anthropic 在 2024 年 10 月推出 Claude Computer Use,Google 在 2025 年 12 月发布 Project Mariner 的企业预览版,把这一方向推向主流。然而,从"能跑通"到"能上生产",中间隔着大量工程化细节。本文基于这三家厂商的公开技术文档,以及 Stripe、Notion、Linear 等早期接入客户的工程分享,梳理浏览器智能体在企业落地中的关键挑战。
一、为什么浏览器智能体有吸引力
企业 90% 以上的核心系统都跑在浏览器里:CRM、ERP、财务 SaaS、内部知识库、行业垂直平台。这些系统的 API 覆盖率参差不齐——有的开放完整 OpenAPI,有的只有有限集成,有的根本不暴露 API。传统自动化(RPA)需要逐系统适配,成本高、脆弱、版本敏感。
浏览器智能体的吸引力在于:它绕开 API 适配问题,直接把浏览器作为统一操作界面。理论上,只要人能通过浏览器完成的工作,智能体就能做。这把"系统集成"的工程量,压缩成"提示工程 + 工具配置"的工作量,极大降低了自动化的准入门槛。
二、从演示到生产的六道关卡
但"理论上能做"和"生产上能用"之间,至少隔着六道关卡。
- 视觉理解的稳定性
- 操作动作的可逆性
- 状态持久化与会话管理
- 反爬与风控
- 权限边界与多租户
- 失败恢复与人工接管
- 单步可观测:每一步操作(点击了什么、输入了什么、跳转到了哪里)都要打日志,截图留底,便于事后回溯。
- 任务可观测:整个任务的进度、耗时、token 消耗、错误次数,实时上报到监控面板,异常自动告警。
- 业务可观测:任务结果是否符合业务预期(订单是否提交成功、数据是否抓全、金额是否正确),需要业务方定义的"验收规则"来判定,而非依赖智能体自评。
- 从只读场景开始——数据抓取、报表生成、信息聚合,这些场景没有不可逆操作,失败成本低。
- 引入可观测性基础设施——日志、截图、监控面板,先把"看得见"做扎实。
- 设计权限边界——为每个智能体分配独立账号,不共享超级账号。
- 谨慎引入写入场景——表单填写、订单提交,必须配二次确认和人工复核。
- 建立失败恢复流程——单步重试 + 子任务回退 + 任务熔断,逐层上线。
- 持续迭代验收规则——业务方定义的"什么算成功",是智能体不断校准的依据。
浏览器智能体依赖截图 + DOM 两种感知方式。截图让模型看见"屏幕长什么样",DOM 让模型知道"页面上有哪些元素"。问题在于:同一个按钮在不同分辨率、不同主题、不同弹窗状态下,外观差异可能极大;而 DOM 结构也可能因 A/B 测试而漂移。生产环境的视觉理解,必须容忍"今天长得不一样",而不是硬编码坐标。
Anthropic 在 Computer Use 的官方文档中明确指出:截图分辨率建议 1024×768 或 1456×800 两种标准尺寸,偏离这个范围会显著降低识别准确率。同时建议关闭高 DPI 缩放、关闭动效、关闭浏览器原生通知,把所有"视觉噪声"前置过滤。
浏览器智能体的动作集合(点击、输入、滚动、跳转)看似原子,实际很多是不可逆的:点击"删除"按钮、提交支付表单、修改账户设置。生产环境必须把这些动作分级:只读操作可自动执行,写入操作需要二次确认,关键操作需要人工复核。
这种分级机制不是"加个弹窗"那么简单。它要求系统能够识别"当前操作属于哪一类",而这个判断的依据是页面上下文 + 动作意图 + 业务规则三者的综合。简单关键词匹配会漏判,深度推理又会拖慢响应,需要在两者之间找平衡。
浏览器智能体天然是"无状态"的——每次启动都从冷启开始。但企业任务常常需要跨会话延续:上午开了个订单未提交,下午继续;昨天抓了 200 条数据,今天要做分析。这种"任务连续性"要求显式的状态持久化机制。
主流做法是把任务进度(已完成的步骤、当前页面快照、下一步意图)写入外部存储,启动时按需回灌。Anthropic 在 Claude 4 的会话持久化中,推荐使用结构化 JSON 而不是自由文本,因为结构化字段更容易被下一次推理消费。
浏览器智能体在生产环境必然会撞上反爬机制:频率限制、行为指纹、验证码、IP 黑名单。这些机制原本是为了阻止恶意爬虫,但智能体的"高频、规整、可预测"操作模式恰好与爬虫特征重合。
解法不是"绕过风控",而是"显式合规"。企业级浏览器智能体应该:使用固定 IP 池(避免住宅代理漂移)、控制操作频率(模拟人类节奏)、主动识别验证码(不试图 OCR,而是触发降级路径)、记录所有操作日志(便于事后审计)。Stripe 在 2026 年初的工程博客中分享,他们专门为浏览器智能体开发了一套"行为节流器",把连续操作的时间间隔随机化到 0.8-3.2 秒之间,显著降低了被风控拦截的概率。
一个企业内部往往有多个业务线,每个业务线的敏感程度不同。浏览器智能体不应该拥有"超级账号"——能访问所有系统、所有数据。生产环境必须把权限边界下沉到智能体级别:财务智能体只能用财务账号,运营智能体只能用运营账号,跨账号操作必须经过授权。
这种"智能体即用户"的权限模型,要求企业把现有的 IAM(身份与访问管理)体系延伸到智能体层。具体落地包括:为每个智能体实例分配独立账号、独立会话、独立审计日志;为敏感操作设置"双智能体"机制(一个执行、一个复核)。
生产环境必须假设:智能体在某一步失败,需要人工接管;或者智能体在执行中识别到异常,主动暂停并请求人工介入。这种"人机协作"的模式,要求系统提供清晰的"上下文交接":智能体把当前页面状态、已完成步骤、未完成步骤、卡在哪一步,全部以结构化方式呈现给接管人。
Linear 在 2026 年 4 月公开的工程实践中,把这种交接设计成"任务卡片":智能体在 GitHub Issue 上创建一张卡片,标题是任务名,描述里附上截图、当前 URL、下一步建议,人工接管后直接在卡片上继续。这种"卡片即工单"的设计,比传统的"日志 + 命令行"友好得多。
三、MCP:标准化工具协议
2025 年下半年开始流行的 MCP(Model Context Protocol)协议,为浏览器智能体提供了一种标准化的工具暴露方式。Anthropic 在 2025 年 11 月开源 MCP,半年内被 OpenAI、Google、Microsoft 相继采纳。MCP 的核心思想是:把工具的元数据(名称、描述、参数 schema)以结构化方式暴露给模型,而不是让模型从自然语言文档中"猜"怎么调用。
对浏览器智能体而言,MCP 的价值在于:把"操作浏览器"封装成标准工具集(browser_click / browser_type / browser_navigate / browser_screenshot),不同厂商的智能体都能消费同一套接口,降低了工具适配成本。
四、可观测性:被低估的基础设施
很多团队在浏览器智能体落地时,把精力放在"如何让智能体做对",却忽略了"如何知道智能体做对没有"。生产环境的可观测性必须覆盖三个层面:
可观测性不是"加分项",而是"基线项"。没有可观测性的浏览器智能体,生产环境跑一天就会失控。
五、落地建议
对于正在评估浏览器智能体落地的团队,建议按以下顺序推进:
结语
浏览器智能体是企业自动化的一次范式跃迁——从"适配 API"到"操作界面",大幅降低了系统集成的工程量。但生产环境的稳定性,依然取决于权限设计、可观测性、失败恢复这些"老问题"的扎实解决。当这些基础设施到位,浏览器智能体才能从"演示惊艳"走向"日常可靠",真正嵌入企业的业务链路。