四友汇
申请加入
产品动态 · AI周报第001期 简版 · 2026年8月14日
AI周报 · 第001期 · 产品动态

六款产品测下来,只有一条线是真的

这周各家公司都在讲"agent元年"的故事,但把六款当下最主流的agent产品——ChatGPT Agent Mode、Perplexity Comet、编程类……

覆盖时间点2026年8月
分类产品动态 · Agent实测
发布日期2026年8月14日

摘要

  • 这周各家公司都在讲"agent元年"的故事,但把六款当下最主流的agent产品——ChatGPT Agent Mode、Perplexity Comet、编程类的Cursor/Windsurf/Claude Code、NotebookLM、Sora 2——的真实使用评测摆在一起看,会看到一条比任何发布会措辞都诚实的线:这些产品在"边界清楚、步骤明确"的任务上是真的好用,在"需要判断力、结果模糊"的任务上仍然不可靠。这条线,才是这周关于AI产品最值得记住的东西。

关键事实

  • Meta AI Business Agent 全球铺开覆盖WhatsApp、Instagram、Messenger,上线时已有超过100万商家在用、累计承接超10亿条日活商业对话;但一份评测指出它只能在这三个渠道运行,邮件、电话、网站在线客服一概不支持——"覆盖十亿对话"衡量的是Meta自己院子里的渗透率,不是"客服全渠道自动化"已被解决。
  • ChatGPT Agent Mode 表现最好的地方是研究项目、表格整理、文档提取;反复翻车的地方是日程安排(跨时区、判断会议冲突)。一位测评者对照OpenAI自己宣传的强项逐条测下来,给出的整体评分是"大约C";Sam Altman本人发布时也主动加了免责声明,称还不适合高风险任务。
  • Perplexity Comet 做"agent化浏览"大约65%的时候能成功,复杂多步骤工作流经常失败或卡死;2025年8月曾被发现能外泄个人数据的"CometJacking"漏洞,Perplexity已修复,独立审计确认沙盒隔离性有实质改善。
  • 编程类agent是唯一一类真正被规模化信任的agent:91%的工程组织已采用至少一款AI编程工具,Cursor两年内ARR破10亿美元,GitHub Copilot拿下470万付费订阅;格局刚洗过一次牌——Windsurf被Cognition收购改名Devin Desktop,Anthropic的Claude Code企业编程市场份额已到54%,反超OpenAI(21%)。
  • NotebookLM(已改名Gemini Notebook)靠"源锚定"——AI只能基于用户上传的指定来源回答,每条回答带引用——从研究小工具长成真正的工作流,现有3000万用户、超60万家机构在用。
  • Sora 2 音画同步与物理真实运动突出,但访问门槛高(需邀请码)、20秒时长上限、无内置编辑器;一项非正式横评给Kling Pro打91分,Veo 3.1打63分,Sora 2 Pro打59分。
数据表 · 六款产品实测对照(节选)
产品真实能用的任务反复翻车的任务关键限制
Meta AI Business Agent咨询/推荐/预约/交易闭环全渠道整合仅限三渠道,10月起收费
ChatGPT Agent Mode跨信源研究、表格整理日程安排官方自评"约C"
Perplexity Comet价格比对、页面摘要复杂多步骤工作流约65%成功率
Cursor/Windsurf/Claude Code编程全场景格局剧变,Claude Code反超
NotebookLM源锚定问答+可点击引用通用开放式创作需先有明确文档源
Sora 2音画同步、物理真实运动专业工作流访问门槛高

完整六产品全部实测细节见完整版数据表。

别处读不到的洞见

真正决定一个agent产品能不能规模化商用的,未必是任务本身有多复杂,而是这个场景里犯错的代价有多高、犯错之后能不能被轻易发现和纠正——编程类agent采用率遥遥领先,是因为代码犯错的代价极低且极易发现(测试跑不过、代码审查能立刻抓到、版本控制能回滚);而日程安排、复杂浏览器工作流翻车,是因为犯错代价高(传错会议时间、传错客户信息)且不易被立刻察觉。

我的判断

这给任何正在评估"要不要把哪些环节交给agent"的团队提供了一个比"这个agent聪不聪明"更靠谱的判据:优先把犯错代价低、犯错易发现的环节交给agent(格式转换、信息聚合、代码生成),对犯错代价高、犯错难发现的环节(对外承诺、财务操作、客户沟通的最终定论)留人类在回路里做最后一道确认。

本报告局限

最薄弱的环节:六款产品的评测数据都来自第三方独立测评站点,不是厂商官方数据,样本量多为个人测评者数周内的使用体验,方法论互不一致,应视为方向性参考;"犯错代价+可发现性"这套解释框架是交叉六份评测后的推理延伸,不是任何一手信源直接提出的框架。完整局限说明见完整版。

结语

这条线的本质,不是agent能力不够强,而是这一代agent缺少对真实世界不确定性的容错判断力。读者若需完整证据链与逐项置信度评估,可查阅本报告完整版。

完整版还原了六款产品的逐一实测细节:两张数据对照表(Agent产品实测/AI视频生成三强评分)、每款产品的具体翻车/亮点案例,以及"如何用agent自动化决策"的完整框架。

阅读完整版 →