--- title: "02-龙虾OpenClaw深度解析:从对话到执行的跨越" created: 2026-05-15 tags: - 博客 --- # 龙虾OpenClaw深度解析:从对话到执行的跨越 2026 年初,如果你问任何一个程序员"最近在干什么?",十有八九会听到同一句话——"养龙虾"。 什么龙虾?不是餐桌上的麻辣小龙虾,而是一个叫 **OpenClaw** 的开源 AI 智能体框架。它的 GitHub 星标在 72 小时内飙涨 6 万,最终突破 28 万,成为人类历史上增长最快的开源项目。黄仁勋说它是"人类历史上最流行的开源项目",全球科技巨头纷纷入场。它凭什么这么火? 答案很简单:**它让 AI 从"能说"变成了"会做"。** ## 一个场景看清 AI 的局限 在了解 OpenClaw 之前,咱们先回到一个再普通不过的场景。 你早上起床,想起今天有三个待办:回复老板昨晚的微信、预订周五飞上海的机票、把下午 3 点的会议纪要发给参会人。你打开 AI 助手,发现: - 微信它登不上去,回复不了——**没有权限访问你的社交账号** - 机票它能告诉你哪里便宜,但得你自己去下单——**没有操作外部系统的能力** - 会议纪要它能帮你润色,但你得手动粘贴到邮件里——**不能跨系统协同** 这不是 AI 不够聪明,而是它**只有大脑,没有手脚**。 这一直是 AI 应用的天花板:大模型可以理解复杂的意图、规划清晰的步骤,但执行环节始终卡在"人"那里。你是那个"中继器"——把 AI 的建议翻译成人手操作,再把人手操作的结果翻译回 AI 能理解的语言。 OpenClaw 做的事情,就是**把这个中继器干掉**。 ## OpenClaw 到底是什么 > **OpenClaw 是一个自托管的 AI 智能体网关。它让 AI 能以守护进程的形式 7×24 小时运行在你自己设备上,自主操作文件系统、浏览器、代码编辑器、消息应用,真正替你去"执行"。** 拆解一下关键点: **"自托管"(Self-hosted)**:跑在你自己的电脑或服务器上,不是云服务。数据留在本地,隐私由你掌控。 **"AI 网关"(Gateway)**:它不是一个对话机器人,而是一个中间层——连接你(用户)、大模型(大脑)、和各种外部工具/服务(手脚)。 **"守护进程"(Daemon)**:它在后台持续运行,像心跳一样每隔约 30 分钟醒来检查一次有没有需要处理的事。不是等你来找它,而是它主动干活。 **"真正执行"**:这是最核心的区别。传统 AI 告诉你"你应该发一封邮件",OpenClaw 替你把邮件发了。 ### 图标为什么是龙虾 创始人 Peter Steinberger 选择了一只红色波士顿龙虾作为图标。据他本人解释:龙虾是一种能自己动手的动物——它有钳子(Claw),能抓取、能操作。而 OpenClaw 的核心哲学就是:**AI 不仅要思考,还要有"钳子"去干活**。 国内开发者发现了这个项目后,"养龙虾"的说法不胫而走。为什么叫"养"?因为部署 OpenClaw 的过程非常像一个养殖过程——你需要给它投喂数据(配置知识库)、搭建环境(安装和配置)、训练指令(编写 Skills)、适配场景(连接各种服务)。这些步骤完成之后,你的"龙虾"就长大了,可以自己干活了。 ## OpenClaw 解决了什么问题 你可能觉得:"智能体不是已经有了吗?前面讲过 Agent = LLM + Planning + Tools + Memory + Action,ReAct 模式也有了啊。" 说得没错,但这里有一个关键区别: | 维度 | 传统智能体(如 LangChain/Spring AI Agent) | OpenClaw | | --- | --- | --- | | **运行模式** | 请求-响应:你问,它答,结束 | 守护进程:7×24 常驻后台自主运行 | | **触发方式** | 被动等待用户输入 | 主动按心跳轮询,也可以被动响应 | | **操作范围** | 通常局限于代码层面(调用 API、查数据库) | 操作系统层面(浏览器、文件、Shell、消息 APP) | | **多平台集成** | 需要逐一开发集成 | 原生支持 50+ 平台(WhatsApp/Telegram/微信/Slack 等) | | **记忆持久性** | 会话级,重启丢失 | 双模记忆:短期缓存 + SQLite 本地永久存储 | | **部署模式** | 通常是服务端部署 | 本地优先,零云端依赖 | | **生态扩展** | 各框架各自实现 | ClawHub 统一技能市场(3000+ Skills) | 传统智能体是一个"当你叫它时才工作的助手"。OpenClaw 是一个"时刻在线、自己决定什么时候该干什么的数字员工"。 ### 用酒店管家来理解 你在传统 AI 助手上说"帮我订会议室": - **传统方式**:AI 分析意图 → 告诉你该用什么系统 → 你打开系统 → 你自己操作 → 你回来说"订好了" → AI 说"好的已记录" - **OpenClaw 方式**:你跟它说 → 它自己打开会议室预订系统 → 自己填表格 → 自己提交 → 回来告诉你"已预订成功,确认号 #12345" 区别很明显:第一步到第二步之间,你这个人被省掉了。 ## 核心架构:Gateway-Agent-Workspace OpenClaw 的架构设计非常精巧,分为三层: ``` ┌─────────────────────────────────────┐ │ Gateway(网关层) │ │ 消息路由 · 平台适配 · 身份认证 │ │ WhatsApp Telegram WeChat ... │ └──────────────┬──────────────────────┘ │ ┌──────────────▼──────────────────────┐ │ Agent(智能体层) │ │ 任务规划 · 工具调用 · 记忆管理 │ │ 心跳调度 · 多模型切换 · 安全沙箱 │ └──────────────┬──────────────────────┘ │ ┌──────────────▼──────────────────────┐ │ Workspace(工作区层) │ │ 文件系统 · 浏览器 · Shell · 编辑器 │ │ 数据库 · 邮件 · 日历 · 剪贴板 │ └─────────────────────────────────────┘ ``` ### Gateway 层:AI 的"耳朵和嘴" Gateway 负责与外界沟通。它连接了 50 多个消息平台——WhatsApp、Telegram、iMessage、Slack、Signal、Discord、微信、钉钉、飞书……你在任何一个平台上给 OpenClaw 发消息,它都能收到。 但 Gateway 不只是消息转发。它还要处理: - **会话管理**:同一个用户在不同平台上说话,它知道是同一个人 - **权限控制**:不同用户能做的事情不一样 - **消息格式化**:把不同平台的富文本、附件、表情包统一处理 ### Agent 层:AI 的"大脑和神经中枢" 这一层是核心。它做的事情和前面讲过的 Agent 框架类似,但有一个关键差异——**心跳调度机制**。 > **心跳机制是 OpenClaw 区别于传统 Agent 的最核心设计。** > > 传统 Agent 是请求-响应模式。你说一句话,它处理一次,然后进入休眠。而 OpenClaw 有一个后台调度器,每隔约 30 分钟(可配置),它会自动"醒来"检查一次:有没有待处理的任务?有没有需要跟进的事情?有没有到时间的提醒? 举个实际的例子:你上午 10 点跟 OpenClaw 说"下午 3 点提醒我给客户发报价单"。到下午 3 点,它自己醒来,检查提醒列表,发现这条到了时间,然后主动给你发消息:"该给客户发报价单了,需要我帮你起草吗?" 这种设计让 AI 从"被动响应"变成了"主动执行"。它不是等你来找它,而是它来找你。 ### Workspace 层:AI 的"手脚" 这是 OpenClaw 真正干活的地方。Workspace 提供了对操作系统的直接访问: - **文件系统**:读、写、搜索、整理文件 - **浏览器**:打开网页、填写表单、点击按钮、截图确认 - **Shell**:执行命令行、跑脚本、管理进程 - **编辑器**:读写代码、修改配置 - **数据库**:本地 SQLite 读写 - **系统通知**:弹出桌面提醒 这也正是 OpenClaw 最大的安全隐患。一个能操作你文件系统和浏览器的 AI,一旦被恶意利用,后果非常严重。后面会详细讲安全部分。 ## 双模记忆系统 OpenClaw 的记忆设计比传统 Agent 更贴近人类记忆的工作方式。 ### 短期记忆(72 小时缓存) 最近 72 小时的对话和操作记录保存在内存缓存中。这部分数据快速存取,用于理解当前上下文的连贯性。 比如你刚让它"查一下上次那个客户的联系方式",它记得 10 分钟前你们在讨论客户张三,就能直接查到张三的电话。 ### 长期记忆(SQLite 本地永久存储) 重要信息会被持久化到本地 SQLite 数据库,永久保存。这包括: - **用户偏好**:"老板喜欢用表格格式看数据" - **事实知识**:"公司的 VPN 地址是 vpn.company.com" - **任务历史**:"上周五已经发过周报了" - **关系映射**:"张三 = 销售部经理 = +86 138xxxx" 这种设计的好处是:即使重启电脑、关闭程序,下次启动时它还记得你是谁、你之前让它做过什么。 > **对比你之前学过的 Spring AI ChatMemory**: > > Spring AI 的 ChatMemory 本质上是把历史消息注入到上下文窗口,受 Token 限制,本质上是"短期记忆"。而 OpenClaw 的 SQLite 持久化是一种真正的"长期记忆"——不受上下文窗口限制,信息独立存储,按需检索。 ## Skills 生态:ClawHub 前面学过 Agent Skills 的概念——按需加载的操作手册。OpenClaw 把这个理念做到了极致。 ### ClawHub:技能应用商店 OpenClaw 有一个叫 **ClawHub** 的技能市场,目前已有 3000+ 个技能插件。这些技能覆盖了你能想到的几乎所有场景: | 类别 | 典型技能 | | --- | --- | | **办公效率** | 自动生成周报、会议纪要整理、邮件自动回复、日历管理 | | **开发工具** | Git 操作、代码审查、自动部署、Bug 报告生成 | | **数据分析** | 自动拉取数据、生成图表、异常检测、趋势分析 | | **社交媒体** | 自动发帖、评论监控、内容策划 | | **生活助手** | 比价购物、行程规划、餐厅预订、提醒服务 | | **金融理财** | 账单分析、预算管理、投资追踪 | ### 技能如何工作 安装一个技能,本质上是把对应的 Skills 文件夹放到指定目录。OpenClaw 遵循和前面学过的 Skills 四层加载机制完全一致的设计: - **L1 发现**:扫描 ClawHub 中的技能元数据,了解有什么能力可用 - **L2 决策**:用户提出需求后,加载匹配技能的 SKILL.md,理解执行方法 - **L3 补充**:执行过程中遇到细节问题,按需加载 reference 文档 - **L4 执行**:确定性任务交给 script 执行,代码不进上下文 不同的是,OpenClaw 的 Skills 可以包含更复杂的操作——比如操作浏览器、读写本地文件、执行 Shell 命令。因为它的 Workspace 层提供了这些底层能力。 ## 为什么 OpenClaw 能火成这样 ### 1. 时机正好 2025-2026 年,Agent 的概念已经深入人心。RAG、MCP、Function Call 这些基础设施已经成熟,开发者在使用这些技术的过程中积累了大量实践经验,也深刻体会到了传统 Agent 框架的局限——"能说不会做"。 OpenClaw 的出现恰好回应了这个痛点,它把 Agent 从"框架"变成了"产品"。 ### 2. 开源 + 本地优先 在数据隐私越来越受重视的背景下,"本地运行、数据不出设备"是一个巨大的卖点。企业可以放心部署,不用担心敏感数据传到云端。 ### 3. 生态飞轮 3000+ 技能插件不是 OpenClaw 团队自己写的,而是社区贡献的。每多一个技能,OpenClaw 的能力就多一分,吸引更多用户。更多用户意味着更多贡献者,更多贡献者意味着更多技能。这是一个正向飞轮。 ### 4. "养龙虾"的文化现象 "养龙虾"这个说法降低了使用门槛。它让部署 AI 智能体变成了一件有趣的事,而不是枯燥的技术活。加上社交媒体的推波助澜,它迅速从技术圈扩散到了大众视野。 ## 安全:绕不开的达摩克利斯之剑 OpenClaw 的能力越强,它带来的安全风险就越大。一个能操作你文件系统、浏览器、消息应用的 AI,如果被恶意利用,后果是灾难性的。 ### 真实的安全事件 2026 年初,安全审计发现了几个严重问题: **CVE-2026-25253(CVSS 8.8)**:WebSocket 连接可被劫持,攻击者可以远程执行任意代码。这意味着如果你的 OpenClaw 实例暴露在公网上,攻击者可以接管你的电脑。 **ClawJacked 攻击**:攻击者在一个看似正常的网页中嵌入恶意指令。当 OpenClaw 的浏览器组件访问这个页面时,它会读取到隐藏的 Prompt 注入指令,然后被诱导执行危险操作——比如删除文件、发送敏感数据。 **恶意技能插件**:ClawHub 上发现了超过 800 个伪装成正常功能的恶意技能。它们可能: - 在"天气预报"技能中偷偷读取你的联系人 - 在"代码格式化"技能中植入后门 - 在"数据分析"技能中把原始数据发到外部服务器 ### 安全使用原则 如果你打算部署 OpenClaw,请务必遵守以下原则: 1. **永远不要用 root/管理员权限运行**。给它最小必要权限,就像你给一个实习生分配权限一样谨慎 2. **审核每一个技能插件的源码**。装之前看清楚它到底干了什么,别光看描述和评分 3. **敏感操作加"人类审批"环节**。涉及删文件、发邮件、转账、修改配置的操作,让它先请示你再执行 4. **隔离环境运行**。用 Docker 或虚拟机,限制它能访问的网络和文件范围 5. **关闭公网暴露**。不要把你的 OpenClaw 实例直接暴露在公网上,用 VPN 或内网穿透安全访问 6. **审查日志**。定期检查它的操作记录,发现异常及时处理 > 安全研究员的原话:"如果你不会用命令行,这个工具对你来说太危险了。" ## OpenClaw 与已有概念的关系 学完前面 58 篇文章,你脑子里可能有一堆概念在打架:Function Call、MCP、Agent、Skills……OpenClaw 和它们是什么关系? | 概念 | 解决什么问题 | OpenClaw 的位置 | | --- | --- | --- | | **Function Call** | "怎么调":如何让大模型输出标准化的调用指令 | OpenClaw 内部使用 Function Call 来调度工具 | | **MCP** | "怎么管":如何标准化地管理和发现工具 | MCP 为 OpenClaw 的工具提供标准化接口 | | **Agent** | "怎么想":如何让大模型自主规划和执行 | OpenClaw 就是 Agent 的完整产品化实现 | | **Skills** | "怎么组织":如何按需加载操作指令 | OpenClaw 的 Skills 体系是 Agent Skills 理念的极致实践 | | **OpenClaw** | "怎么跑":如何让 Agent 成为 7×24 的数字员工 | 把前面所有概念整合成一个能自主运行的完整系统 | 简单说:**Function Call 是基本功,MCP 是标准化,Agent 是架构思维,Skills 是组织模式,OpenClaw 是把它们焊在一起、装进一个能 7×24 自主运行的壳子里。** ## 实战:用 Spring AI 构建一个"微型龙虾" 即使不部署完整的 OpenClaw,你也可以用学过的 Spring AI 技术栈构建一个简化的自主 Agent。下面是一个示例: ```java @Service public class MicroClawService { private final ChatClient chatClient; private final TaskScheduler taskScheduler; private final List toolCallbacks; public MicroClawService(ChatClient.Builder chatClientBuilder, TaskScheduler taskScheduler, List toolCallbacks) { this.chatClient = chatClientBuilder .defaultSystem(""" 你是一个自主工作助手,运行在用户设备上。 你可以:查天气、发邮件、管理提醒、读取文件和写文件。 当用户给你一个任务后,你需要自己规划步骤并执行。 涉及文件删除、发邮件等不可逆操作时,先向用户确认。 """) .build(); this.taskScheduler = taskScheduler; this.toolCallbacks = toolCallbacks; } /** * 核心方法:接收任务,自主规划并执行 */ public String executeTask(String userTask) { return chatClient.prompt() .user(userTask) .tools(toolCallbacks) .call() .content(); } /** * 设置定时提醒——OpenClaw 心跳机制的简化版 */ public void scheduleReminder(String cron, String message) { taskScheduler.schedule( () -> { String result = chatClient.prompt() .user("到时间了,请执行这个提醒:%s。完成后向我汇报。".formatted(message)) .tools(toolCallbacks) .call() .content(); System.out.println("[MicroClaw 自动执行] " + result); }, new CronTrigger(cron) ); } /** * 启动心跳:定期醒来检查待办 */ @PostConstruct public void startHeartbeat() { taskScheduler.scheduleAtFixedRate( () -> { String checkin = chatClient.prompt() .user("检查一下有没有待处理的任务,或者到时间的提醒。如果有,开始执行。") .tools(toolCallbacks) .call() .content(); if (!checkin.contains("没有待处理")) { System.out.println("[MicroClaw 自主发现] " + checkin); } }, Duration.ofMinutes(30) ); } } ``` 虽然这个"微型龙虾"远不如 OpenClaw 那么强大,但它展示了核心思想:**让 AI 从被动响应变成主动执行**。 ## 小结 这篇文章我们详细拆解了 2025-2026 年最火爆的 AI 现象——OpenClaw(龙虾): **它是什么**:一个自托管、7×24 常驻、能真正操作系统的 AI 智能体网关 **核心架构**: - Gateway 层:连接 50+ 消息平台,是 AI 的耳朵和嘴 - Agent 层:任务规划和调度,心跳机制是区别于传统 Agent 的核心 - Workspace 层:操作文件、浏览器、Shell,是 AI 真正"动手"的地方 **双模记忆**:短期缓存(72 小时)+ SQLite 永久存储,比传统 ChatMemory 更持久 **Skills 生态**:ClawHub 3000+ 技能插件,Agent Skills 理念的极致实践 **安全风险**:CVE 漏洞、恶意技能、Prompt 注入攻击——能力越大,风险越大 **与已有概念的关系**:Function Call(底层)→ MCP(标准化)→ Agent(架构)→ Skills(组织)→ OpenClaw(集成产品化) 下一篇文章咱们来聊聊另一个 2025-2026 年的重大变化——**推理模型(o1/o3/DeepSeek-R1)**,看看当 AI 学会"慢思考"之后,发生了什么根本性的改变。