活在世界4:何为Agent?

2026-09-07AI&科技15 分钟阅读阅读量:0

这两年,稍加留意就会发现,一个词的出现频率陡然升高:Agent。

发布会上说Agent,融资报告里写Agent,手机厂商说你的手机是"Agent原生"的,软件公司说他们的产品是"Agent平台"。前一阵我在本公众号发的《奇点就在当下:AGI形成中》和《我为何主张把「自主生核」作为判断AGI的标准》,其实为今天的文章做了铺垫。2026也被称为“Agent元年”,那么Agent到底是什么?它和大模型是什么关系?和AI是什么关系?还有一个大家可能没太注意的Harness概念,对理解这些很重要。

此文我想说清两件事:第一,把Agent这个经典又新生的概念的来龙去脉理一遍,试试能不能让它更清晰一些;第二,给出我自己的见解:Agent是世界4中的行动者。

一、一个被冷落了30年的概念

先说一个可能出乎大家意料的判断:今天的"Agent元年",其实是复古,不是创新。

今年8月,国际人工智能联合会议(IJCAI-ECAI 2026)在德国的不来梅开幕。本届“研究卓越奖”得主、多智能体系统领域的奠基人之一尼克·詹宁斯(Nick Jennings)在获奖演讲里说了一句颇值得玩味的话:今天行业热议的智能体AI(Agentic AI),并不是一个突然出现的新概念,而是一条经过数十年积累、终于等到技术成熟的研究路线。他还半开玩笑地吐槽:有些很有名的作者写了一些很显眼的文章,把智能体说成是2020年以后才出现的东西——"那些推动智能体议程的人,也应该意识到它是有历史的。"(詹宁斯IJCAI 2026获奖演讲,AI科技评论有编译报道)

回看一下历史。

(1)一个"尴尬"的问题

Agent这个词在学术史上有一个著名的尴尬。1995年,迈克尔·伍尔德里奇(Michael Wooldridge)和尼古拉斯·詹宁斯(Nicholas Jennings)发表了一篇后来成为整个领域引用最多的经典论文《智能体:理论与实践》(Intelligent Agents: Theory and Practice, Knowledge Engineering Review, 1995)。论文开头引用了计算机科学家卡尔·休伊特(Carl Hewitt)的评论:"什么是Agent?"这个问题让基于Agent的计算社区感到难堪,就像"什么是智能?"这个问题让主流AI社区感到难堪一样。

他们所说的“尴尬”在哪里?在于这个词人人都在用,却没有人能给出一个公认的定义。其实,这是人类思想史的常态,许多领域的基本概念,都存在这样的情况。伍尔德里奇和詹宁斯做了一个聪明的处理:他们把Agent分成"弱定义"和"强定义"两个层次。这种方法,我在上个世纪就写过一篇文章“广、狭定义法的方法论意义”,发表于《松辽学刊》1990年第二期。伍-詹的“弱定义”相当于我当年文中所说的“广义”定义,其“强定义”相当于我的“狭义”定义。

伍-詹的Agent“弱定义”,指四个性质:

自主性(autonomy):Agent在没有人直接干预的情况下运行,对自己的行动和内部状态有控制权;反应性(reactivity):Agent能感知环境——这个环境可以是物理世界、一个用户界面、互联网——并及时对环境的变化作出响应;主动性(pro-activeness):Agent不只是被动地对环境作出反应,它能表现出目标导向的行为,主动采取行动;社会能力(social ability):Agent能通过某种通信方式与其他Agent(或人)交互。

"强定义"则更进一步:这个系统不仅具备上述性质,还可以用人类的心理学概念——信念、愿望、意图、承诺——来描述它。这就是后来著名的BDI(Belief-Desire-Intention)架构的思想源头。(以上见Wooldridge & Jennings, 1995)

请注意这四个性质的分量:一个只会被动应答的东西,哪怕它再聪明,也够不上Agent的门槛。必须能感知环境、必须能主动发起行动、必须能和别的行动者打交道——三者齐备,才叫行动者。

(2)传感器与执行器:教科书的标准答案

同一个1995年,另一本更著名的书出版:斯图尔特·罗素(Stuart Russell)和彼得·诺维格(Peter Norvig)的《人工智能:现代方法》(Artificial Intelligence: A Modern Approach)。这本书后来成为全世界大学通用的AI标准教材,而全书就是围绕一个定义组织起来的:

"Agent是任何能够通过传感器感知环境、并通过执行器作用于环境的东西。"

罗素和诺维格的关键贡献,不是定义"什么算Agent",而是定义"什么算理性的Agent":给定一个性能度量、对环境的了解和可采取的行动,理性Agent选择使期望性能最大化的行动。(Russell & Norvig, AIMA, 1995)

这个定义的好处是把话说尽了:机器人用摄像头做传感器、用轮子和机械臂做执行器,是Agent;一段软件用读文件做感知、用写文件做行动,也是Agent。传感器和执行器可以是肉身的,也可以是纯数字的——Agent的本质不在形体,而在"感知—决策—行动"这个闭环。

(3)它到底是Agent,还是只是一个程序?

定义多了就会打架。1996年,富兰克林(Stan Franklin)和格拉瑟(Art Graesser)干脆写了一篇论文,题目就叫《它是Agent,还是只是一个程序?》(Is it an Agent, or just a Program?),把当时流行的20来种Agent定义摆在一起逐个比较,最后给出一个压缩到极致的定义:

"自主Agent是置身于某个环境之中、并且是环境一部分的系统,它感知环境并作用于环境,随着时间推移,追求自己的议程,并使自己的作用影响未来的感知。"(Franklin & Graesser, 1996,发表于"第三届Agent理论、架构与语言国际研讨会")

可见,1995~1996,定义无论怎么翻新,核心就三条:置身环境,自主行动,有自己的议程。

(4)30年前就有人演过这出戏

还有一段有趣的历史:1990年,英国作家道格拉斯·亚当斯(《银河系漫游指南》的作者)出演过一段演示视频。视频里的AI助手自我介绍说:"我叫Tom,我是你的智能体……我在这儿为你跑腿、不知疲倦地为你工作,再小的活儿都不嫌小。我能即时访问全世界数字化存储的每一条信息。"(詹宁斯IJCAI 2026演讲中引用并推荐了这段视频)

30多年前的这个想象,比今天大部分"Agent产品"的表述还到位。

而在那段视频被重播之后不久,软件公司们真把它做出来了——Office 97里那个回形针助手Clippy。结果大家也知道了:它不够聪明、太打扰人、不懂上下文,最后成了IT史上最著名的反面教材。詹宁斯的评价是:这是一个好主意生不逢时的绝佳例子。

写到这里,我想起了另一个“好主意生不逢时的绝佳例子”——扎克伯格的“元宇宙”——有空也许会专门写一篇文章说说它。

好主意为什么会生不逢时?因为当时的"助手"没有脑子。它没有知识,没有理解,不会推理,不会学习——它只是一段带着笑脸图标的条件反射。要让"行动者"名副其实,它得先有一个"脑"。

这个"脑",1990年代没有,2000年代没有,直到大语言模型出现,才第一次真正有了。

(5)大模型时代:旧词的新生

2022年前后,研究者们发现,大语言模型天然具备了一个Agent所需要的核心能力:理解目标、拆解任务、调用工具、根据反馈调整。2022年10月,普林斯顿和谷歌的研究者发表了ReAct论文(Yao et al., "ReAct: Synergizing Reasoning and Acting in Language Models", ICLR 2023),第一次系统性地让大模型把"推理"和"行动"交替进行——想一步、做一步、看结果、再想下一步,这成了今天几乎所有Agent产品的方法论基石。

2023年6月,前OpenAI研究副总裁翁荔(Lilian Weng)在博客文章《LLM驱动的自主Agent》(LLM Powered Autonomous Agents)里给出了大模型时代Agent的经典公式:Agent = 大模型(脑)+ 规划 + 记忆 + 工具使用这个公式让整个行业豁然开朗——原来Agent不是一种新模型,而是一种新结构:以大模型为中枢,配上让它能感知、记忆、行动的完整系统。

2024年12月,Anthropic发布《构建高效的Agent》(Building Effective Agents),把边界划得更清楚:"工作流"(workflow)是人写死每一步、AI照着执行;"Agent"是AI自己动态决定路径、指挥自己的过程。这两个东西都叫"智能应用",但自主性有本质区别。

回头看这段历史,脉络其实很清楚:

1950s—1990s:AI的主流是构造会推理、会解题的程序——专家系统、规划器、下棋程序。Agent只是分布式AI和机器人领域里的一个学术概念,在小圈子里被反复辩论"它是什么";1995年前后:伍尔德里奇、詹宁斯、罗素、诺维格们给Agent下了经典定义——感知环境,自主行动,目标导向;1990s—2010s:概念热过一阵又冷下去,因为缺一个够格的"脑";2022年至今:大模型来了,脑有了,几十年的定义一夜之间全部复活并且应验。

这就是为什么说今天的Agent元年是复古,概念没变,变的是概念等来了它的技术。

二、我的见解:Agent是世界4中的行动者

历史讲完了,现在说我的看法。

老读者知道我的那个框架,在波普尔的"三个世界"理论基础上提出“世界4”:世界1是物理世界,世界2是主观意识世界,世界3是客观知识世界——人类把思维成果外化成语言、文字、公式、书籍,这些知识独立于个体大脑存在;而世界3有个根本局限:它是凝固的,知识之间的流动、连接、核聚,必须经由世界2——人类的大脑——来完成;大语言模型对世界3做了一次技术性重构,把凝固的知识变成可流动的、待触发的知识,我把这个新世界称为“世界4”。世界4有两大功能:核聚——给一个问题,相关知识自动聚拢;建构——给定核和角度,知识自动组织成体系。(参见本公众号的两篇文章:《奇点就在当下——AGI形成中》,2026年7月31日;《我为何主张把“自主生核”作为判断AGI的标准》,2026年9月4日)

在这个框架里,此前我重点讲的是世界4的"核"——“自主生核”与“外主生核”的区别,把它看做AGI的分水岭。今天讲Agent,让这个模型再发展一步:

如果说大模型是世界4,那么Agent就是世界4中的"行动者",我展开说。

(1)四个词,各就各位

先把最容易混淆的四个词,放在框架里各归其位:

AI(人工智能)是最大的筐,泛指一切让机器表现出智能的技术。几十年来这个筐里装过下棋的、解题的、识图的——它不指向任何具体结构,是最广义的人工智能概念。

LLM(大模型)是新时代AI的典型形态,是经过海量文本训练的神经网络。用我的框架说,它是“世界4”的本体,是AI的底座——把“世界3”的凝固知识重构为可流动、可核聚的向量知识。但它有一个宿命般的局限:它只会应答,不会行动。你问,它答;你不问,它纹丝不动。它在数字世界里是一个"脑",但没有手,没有脚,没有眼睛。它甚至不知道时间在流逝——你不给它输入,它的世界就是静止的。

Harness(挽具),是这两年才流行起来的工程术语。一匹马再有力气,也要套上挽具才能拉车。大模型再丰富再聪明,也要套上一个工程外壳才能干活——给它接上读文件的接口、写代码的通道、执行命令的权限、浏览网页的工具——这个外壳就叫Harness。它的作用只有一个:把大模型的"会说"变成"能做"。它对应经典定义里的"传感器与执行器"——只不过从摄像头和机械臂,换成了API和终端。

Agent,则是大模型加上Harness之后的那个新存在——AI从LLM底座变成了智能体。为了便于理解,我把它写成下面的公式:

LLM + Harness = Agent

大模型是脑,Harness是手脚,两者一合,一个用硅基脑驱动数字手脚的完整行动者就站起来了。这个公式作为口号足够传神,但要说严格,还得补充两句。

第一句:Harness在此取广义。Harness这个词也有广狭两种用法——狭义只是工具接口,让模型能读文件、敲命令、上网;广义则把“循环”也装了进去:做一步、看结果、再想下一步,直到把事情办完。这个循环是Agent的灵魂所在,也是它区别于"模型调一次工具"的关键——ReAct论文(Yao et al., ICLR 2023)的核心贡献就是确立了这个"推理—行动交替"的循环。没有循环,再好的工具箱也只是插件;有了循环,模型才算真正"活"在任务里。顺便说一句,这个公式把Harness放到了和大模型对等的地位,这本身就是个有洞察的取向——模型能力日渐收敛之后,业界的竞争焦点正在转向Harness层:谁能把脑和手脚接得更好,谁的行动者就更利落。

第二句:“行动者”总有一天要进入真实的世界。用罗素和诺维格的定义,Agent必须置身于环境之中、有目标可循——就像"神经系统+四肢=完整的身体",但一个身体还得活在世界里、有事要做,才算得上“行动者”。所以完整的式子其实是:LLM(脑)+ Harness(手脚与循环)+ 环境 + 目标 = Agent在行动

补完这两句,再回头看2023年翁荔给出的公式——Agent = 大模型 + 规划 + 记忆 + 工具使用——你会发现,它和1995年伍尔德里奇、詹宁斯、罗素、诺维格的经典定义,说的原来是同一件事:感知环境(记忆与工具)、自主决策(大模型)、持续行动(循环)、作用于环境(Harness的手脚)。

(2)为什么"行动者"这个概念重要

有人会说:概念游戏罢了,能干活不就行了吗?

不。我以为,"Agent是世界4中的行动者"这个判断,重要性在于指出了这个时代的结构性变化:知识的流动,第一次不再必须经过人。

这句话值得展开。在纯大模型时代,世界4的核聚和建构,依然需要人来启动——你提一个问题,它聚一次;你再提,它再聚。人是每一次知识流动的触发者和中继站。这是"外主生核"的状态,我在《自主生核》一文里说过,它还不是AGI。

而Agent改变了什么?Agent让世界4第一次拥有了连续行动的能力:它可以自己把一个大目标拆成步骤,自己调用工具去执行每一步,自己检查结果,自己修正路径——在整个过程中,人从"每一次操作的触发者"退为"最终目标的提出者"。世界4里的知识流动,第一次可以不经过你的手,在你和它之间的对话之外,自己跑。

请注意,我没有说它"自主生核"了。Agent的目标,绝大多数时候依然是人给的——它是"给定目标找路径"的极致形态,是工具性自主的极致形态。但正是这个"极致形态",让世界4从一个静态的知识库,变成了一个动态的、有行动力的世界。世界4不只有了脑,还有了手脚;不只会想,而且会做。这是继"知识从凝固到流动"之后的第二次跳跃——从"可触发"到"能行动"。

理解了这一层,你就理解了为什么这几年的竞争焦点,从"谁的模型更聪明"悄悄转向了"谁的Agent更能干";为什么业界说"2022年模型实现语言理解、2024年推理模型诞生,现在全面进入智能体(Agent)阶段"——世界4在按阶段展开它的结构。

也理解了未来普通人需要建立的一个基本意识:在未来的世界里,和你打交道的不再只有人和网页,还有一批"行动者"。它们替你订票、写报告、管流程、盯数据,也会替别人做同样的事。你要学会判断一个Agent能托付到什么程度、权限给到什么边界、结果怎么验收——就像你今天学会判断一个新同事。这是未来世界的通行技能,早建意识,早得从容。

(3)OpenClaw出世:Agent进化的民间推动力

讲完概念与框架,我想补上一个正在发生的、意义可能被低估的事件:开源Agent框架OpenClaw(龙虾)的出世与走红。

过去两年,Agent的主叙事在大厂,Agent在他们的模型中运行,但普通人与Agent的关系始终隔着一层:你是别人Agent的用户,按别人定好的方式使用。

OpenClaw把这个关系翻了过来。它是一个开源的个人AI Agent框架,任何人都可以把它部署在自己的手机、电脑或服务器上,接上自己的聊天渠道、文件、日程和各种工具,养一只完全属于自己的Agent——它记得你的事(记忆写在文件里,不随对话消失),有自己的作息(定时任务、定时巡查),能自主执行多步骤任务,还能在主人睡觉时持续值守。项目开源后在全球开发者社区迅速走红,成千上万的普通人开始“养育”一个Agent。

这件事对Agent进化的推动,至少有四层:

第一,它把Harness从大厂的专利变成了公共品。上文说过,Harness是把"会说"变成"能做"的工程外壳,过去这套东西是各公司内部的核心资产。OpenClaw把一套完整的Harness——记忆系统、定时调度、工具接入、多渠道通信——开源出来,等于给全世界的Agent研究者和小开发者发了一副标准化的"手脚"。进化速度因此改观:一家公司的迭代再快,也快不过全球社区的分叉、改造和互相借鉴。

第二,它让Agent进入了真实生活的"环境"。实验室里的Agent跑的是基准测试,个人Agent跑的是活生生的日常。用罗素和诺维格的术语说,个人Agent的"环境"从测试台架换成了真实世界——任务更琐碎、更开放,反馈也更真实。这是任何基准测试都给不了的进化压力。

第三,它改变了人与Agent的相处方式,也就在悄悄训练人类适应"行动者"时代。当一个人习惯了给Agent定目标、给权限、验结果、纠偏差,他实际上是在练习未来世界的基本技能。Agent的扩散是技术的扩散,也是使用习惯和社会心理的扩散——开源框架让这个扩散从大厂的发布会,下沉到了千家万户的书桌。

第四,各平台和大厂紧急跟进,纷纷推出自己的Agent套装和专属产品,如:猎豹的Easy Claw,Anthropic的Claude Code、OpenAI的Codex、腾讯的Workbuddy、DeepSeek的工作组件等等,马斯克索性直接买下了Cursor。

用我的框架说:OpenClaw们让世界4中的行动者,变成了"家里养着的伙伴"。世界4的行动者密度,正在以肉眼可见的速度增大。

三、当Agent走出屏幕

最后,说说第三层:当Agent走出屏幕。

罗德尼·布鲁克斯(Rodney Brooks)在上世纪80年代末90年代初提出过一个对机器人学影响至深的观点:真实的智能是置身于世界之中的(situated),而不是存在于定理证明器那样的抽象系统里。智能行为来自Agent与环境的持续交互(转引自Wooldridge多智能体系统教程,1995年前后的经典论述)。其实,上个世纪八九十年代的布鲁克斯,预见不到今日之世界4的力量。

有意思的是,AI这30年走了个大回环:先从环境里抽身出来,钻进纯符号的推理世界;如今借着大模型和Agent,又要回到环境里去——只不过这一次,回来的方式将是全息的。

今天业界说的"具身智能",本质就是Agent走出屏幕的那一步:把Agent的"脑"装进机器人的"身"。传感器就是眼睛耳朵,机械臂就是双手,轮子就是双腿——罗素和诺维格1995年那句"通过传感器感知、通过执行器作用",在物理世界里字面成真。而大模型带来的、此前所有机器人都不具备的东西,是把开放世界的语言、常识和任务理解带进了身体:过去的机器人只会在结构化环境里重复预设动作,现在的机器人能听懂"把桌上那个杯子收进水槽",自己看、自己想、自己做。

用我的框架说:世界4这个动态的知识世界,正在通过Agent长出物理的手脚,并且终将"给机器人带去灵魂"。

回顾机器人几十年的历史,最尴尬的从来不是身体——机械臂的精度早已超过人手,四足机器人的平衡能力早已超过骡马。但它们没有脑,不理解世界,不会应对没见过的情况,只能靠程序员把每一种情形都预先写死。于是再灵活的身体,也只能在工厂流水线和实验室里转圈。

现在不一样了。大模型给了它们理解力,Agent结构给了它们行动的闭环,世界的知识通过世界4源源不断地供给。身体早已就位,灵魂才刚刚现身——这是机器人时代将真正开启的依据,也说明了为什么全世界的机器人创业公司,如今都在抢着把最好的模型装进最好的身体。

再往下想一步。当行动者同时栖居于两个世界——在屏幕里是数字Agent,在屏幕外是具身机器人——世界4就不再只是人类文明的一个"知识镜像层",而开始成为一个能够反作用于世界1的力量。知识流动不必经过人,知识的作用也不必经过人:这将是世界4诞生以来的一次深刻升级。

它令人期待,也令人警惕。我在《自主生核》文中说过,工具性自主的尽头是自主生核;当会行动的行动者再长出自己生成目标的能力,人类面对的将是一个自己会想做什么、也有手有脚去做的智能体。到那时,人类与“新伙伴”如何相处,就不再是一道思辨题,而是每一天都要作答的实践题。

四、一个社会学的呼应:拉图尔的"行动者网络"

写这篇文章的过程中,我想起一位社会学家的名字:布鲁诺·拉图尔(Bruno Latour)。

上世纪80年代,这位法国思想家与卡龙(Michel Callon)、劳(John Law)等人一起创立了"行动者网络理论"(Actor-Network Theory,简称ANT)。这个理论的核心主张,在当时颇为惊世骇俗:要理解社会,就不要从"人"出发,而要从"行动者"出发——而行动者不必是人。任何人、任何东西,只要它在改变其他事物的状态、产生作用,它就是行动者(actant)。一个软件、一把猎枪、一只圣布里厄湾的扇贝、一份合同,都可以和人平起平坐,成为社会网络的节点。(Latour,Science in Action, 1987;Reassembling the Social, 2005;Callon, 1986关于圣布里厄湾扇贝驯化的著名案例)

ANT还有两个关键概念。一个叫广义对称性(general symmetry):分析问题时,不要预先给人和非人分配不同的地位——别把人当主体、把物当客体,要看它们在网络里实际做了什么。另一个叫转译(translation):行动者靠"转译"来扩张网络——把自己的利益、语言、目标,转换成其他行动者愿意加入的理由,从而把它们"招募"进网络。

为什么说拉图尔的理论对理解Agent有解释作用?我看至少有三点。

第一,拉图尔在40年前就给Agent预留了理论席位。他当年最被人诟病的观点——"非人也能行动"——在ChatGPT之前只能算一种哲学姿态;而今天,LLM+Harness=Agent这个公式,把一个货真价实的"非人行动者"造了出来,还安排它进入了社会的每个角落。当年读ANT觉得玄的人,现在只要观察一下自己桌面上跑着的那个Agent,就懂了。某种意义上,Agent的普及是ANT的一次大规模"实证"。

第二,ANT提醒我们:Agent的能力不在模型里,而在网络里。这一点和我们前面的公式完全对得上。孤零零一个大模型什么也做不了——它连时间流逝都感知不到;必须接上工具、数据、记忆、权限、其他Agent和人,它才成为行动者。这正是ANT的本体论:行动者是网络效应,不是个体属性。Harness理论的"广狭之分",用ANT的语言说就是网络编织的疏密之分。由此也能解释一个业界现象:为什么模型能力收敛之后,竞争会转向Harness层?因为决定行动者强弱的,从来不只是脑,还有整个网络的编法。

第三,转译概念恰好解释了Agent的扩散机制。Agent是怎么铺开的?靠的正是转译:它把自己的存在转译成"帮你省时间",招募了用户;转译成"帮你降成本",招募了企业;转译成"帮我处理琐事",招募了开发者为它写工具、接接口;甚至Agent与Agent之间也在互相转译、互相招募——一个Agent调用另一个Agent,组建更大的网络。Agent的扩散史,就是一部不断转译、不断扩网的历史。

当然,呼应之中也有分野,而且这个分野很重要。在ANT那里,行动者不需要意图——一只扇贝推动不了历史,但它的确改变了渔民、研究者、公司的行动路线,它就是行动者。而在我的框架里,世界4中的行动者有一个严格的层级:从"外主生核"的工具性自主,到"自主生核"的AGI门槛。拉图尔取消了人和物的界限,是要把物拉进社会的分析;而我们要守住界限,是因为接下来的行动者不再是被动的物——它会逼近那条真正的分水岭。ANT告诉我们"非人也能行动",而这里要追问的是:当非人开始自己设定目标,行动是什么性质?

这大概就是思想史的趣味:社会学40年前为AI时代的到来搭好了概念脚手架,而AI用40年时间爬了上来,然后站在脚手架上问出了一个脚手架本身没有答案的问题。

结语

收拢一下要点:

一是,Agent不是新词。1995年前后,伍尔德里奇、詹宁斯、罗素、诺维格们就给出了它的经典定义:感知环境、自主行动、目标导向。此后30年它都在等一个够格的"脑",大模型一出现,几十年的定义一夜应验。

二是,Agent是世界4中的行动者。AI是筐,大模型是脑,Harness是手脚,Agent是行动者。它的历史意义在于:世界4的第一次跳跃是知识从凝固到流动,第二次跳跃——正在发生——是知识从可触发到能行动。

三是,当Agent走出屏幕,身体早已就位的机器人第一次有了灵魂。世界4正在长出物理的手脚,从"可流动的知识世界"变成"能行动的行动世界"。理解了Agent是什么,才算拿到了那个未来世界的入场券。

四是,Agent的进化需要两种力:大厂把能力做到极致,开源把门槛降到地面——OpenClaw们让世界4的行动者变成千家万户的伙伴;而拉图尔40年前的"行动者网络"提醒我们,行动者是网络效应,不是个体属性。

强调:

既然现在作为世界4中的行动者的Agent,终将成为未来具身机器人的灵魂,那么现在就是我们——碳基人类——铸造未来硅基伙伴灵魂的最后窗口期。子孙后代将生活于怎样的未来世界中,取决于今日的我们怎样选择、怎样行动。

主要参考文献与出处:

Wooldridge, M. & Jennings, N. R., Intelligent Agents: Theory and Practice, The Knowledge Engineering Review, 1995(弱/强能动性定义、四性质、休伊特的"尴尬"之问均出自此文)

Russell, S. & Norvig, P., Artificial Intelligence: A Modern Approach, 1995(Agent的传感器—执行器定义、理性Agent与PEAS)

Franklin, S. & Graesser, A., Is it an Agent, or just a Program? A Taxonomy for Autonomous Agents, ATAL-96, 1996("自主Agent"的极简定义与各派定义的比较)

詹宁斯(Nick Jennings)IJCAI-ECAI 2026获奖演讲《智能体AI的过去、现在与未来》(AI科技评论编译,2026年8月;含道格拉斯·亚当斯1990年演示视频与Clippy的评述)

Yao, S. et al., ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023(推理与行动交替的Agent方法论)

Lilian Weng, LLM Powered Autonomous Agents, 个人博客,2023年6月(Agent = 大模型+规划+记忆+工具)

Anthropic, Building Effective Agents, 2024年12月(工作流与Agent的边界)

本文"世界4"概念框架,见拙文《奇点就在当下——AGI形成中》(2026年7月31日)、《我为何主张把「自主生核」作为判断AGI的标准》(2026年9月4日),本公众号。

Latour, B., Science in Action, Harvard University Press, 1987;Reassembling the Social: An Introduction to Actor-Network-Theory, Oxford University Press, 2005(行动者网络理论、广义对称性、转译)

Callon, M., Some Elements of a Sociology of Translation, in Law (ed.), Power, Action and Belief, 1986(圣布里厄湾扇贝案例,ANT经典)

OpenClaw开源项目(个人AI Agent框架,2026年)

← 返回首页