Gemini 3.5 Flash 原生集成 Computer Use 能力
谷歌在 Gemini 3.5 Flash 中原生集成 Computer Use 能力, 使其能直接在浏览器、移动端和桌面环境下执行视觉识别、逻辑推理与操作指令。据 Google 官方博客, 此前该能力仅作为 Gemini 2.5 的独立模型提供, 现已将 Computer Use 作为内置工具集成至主模型中, 旨在提升长周期任务与企业级自动化的执行效率。

Gemini 3.5 Flash 的 Computer Use 原生集成
Gemini 3.5 Flash 现已支持内置的 Computer Use 工具, 可在浏览器、移动端和桌面环境中执行 agentic 任务。相比之前的独立模型版本, 原生集成显著提升了模型在函数调用 (function calling) 以及结合 Search 和 Maps grounding 等内置工具时的协同能力。
开发者可以使用 Gemini 3.5 Flash 构建自定义 agent, 实现跨平台的软件自动化测试、专业应用知识工作等复杂企业级任务。该能力使模型能够像人类一样观察屏幕、进行推理并执行实际操作, 从而处理具有更长执行路径的自动化流程。
企业级安全防护与对抗训练
针对 agent 在实时环境运行中面临的 prompt injection 风险, 谷歌对 Gemini 3.5 Flash 的 Computer Use 进行了针对性的对抗训练。为了进一步降低风险, 谷歌同步发布了两套可选的企业级安全防护系统:
- 显式确认机制:针对敏感或不可逆的操作, 强制要求用户进行手动确认。
- 自动拦截系统:一旦识别到间接 prompt injection 攻击, 系统将自动停止当前任务。
谷歌建议开发者采用深度防御 (defense-in-depth) 策略, 将上述防护功能与安全沙箱 (sandboxing)、人工审核 (human-in-the-loop) 以及严格的访问控制相结合, 以确保 agent 的运行安全。
接入方式与资源
开发者与企业用户目前可通过 Gemini API 和 Gemini Enterprise Agent Platform 接入 Computer Use 功能。

谷歌已在 Browserbase 托管的环境中提供 Demo 演示, 开发者可直接测试其在实际界面中的操作能力, 并参考官方提供的参考实现与技术文档进行开发。
将 Computer Use 原生集成至 Flash 档位模型, 意味着高性能的计算机操作能力将获得更低的推理成本与更快的响应速度, 这将加速企业级 AI agent 从简单的 API 调用向实际 UI 操作的迁移。

评论 0