四友汇
申请加入
产品动态 · AI周报第001期 完整版 · 2026年8月14日
AI周报 · 第001期 · 产品动态 · 完整版

六款产品测下来,只有一条线是真的

这周各家公司都在讲"agent元年"的故事:Meta把智能体铺进十亿条商业对话,Google让它直接打电话给店家问库存,OpenAI把它塞进ChatGPT日常工……

覆盖时间点2026年8月
分类产品动态 · Agent实测
发布日期2026年8月14日

← 先看简版(3分钟速览)

摘要

  • 这周各家公司都在讲"agent元年"的故事:Meta把智能体铺进十亿条商业对话,Google让它直接打电话给店家问库存,OpenAI把它塞进ChatGPT日常工作流。听发布会,agent已经无所不能了。但把六款当下最主流的agent产品——ChatGPT Agent Mode、Perplexity Comet、编程类的Cursor/Windsurf/Claude Code、NotebookLM、Sora 2——的真实使用评测摆在一起看,会看到一条比任何发布会措辞都诚实的线:这些产品在"边界清楚、步骤明确"的任务上是真的好用,在"需要判断力、结果模糊"的任务上仍然不可靠。这条线,才是这周关于AI产品最值得记住的东西。

Meta把agent铺进十亿条对话,但只敢待在自己的院子里

2026年6月3日,Meta把AI Business Agent全球铺开,覆盖WhatsApp、Instagram、Messenger三个渠道,此前已在印度、墨西哥、巴西试跑近两年。上线时已有超过100万商家在用,累计承接超10亿条日活商业对话,能做客户咨询、产品推荐、预约排期、销售线索筛选,一路做到交易闭环——商家随时能接管对话,AI回复也会标注身份。定价从免费转向按token计费:8月1日起WhatsApp Business Platform用户每百万token收2美元,免费服务将于10月1日终止,一次典型交互约耗2-2.5万token,成本4-5美分。(DataconomyTechCrunch

但一份评测把这个"十亿对话"的说法钉在了一个具体边界上:这个agent只能在WhatsApp、Messenger、Instagram里运行,邮件、电话、网站在线客服、短信一概不支持。需要全渠道覆盖的企业,还得另外看Intercom Fin、Zendesk AI、Salesforce Agentforce。(theaiagentindex)也就是说,"覆盖十亿对话"衡量的是Meta自己院子里的渗透率,不是"客服全渠道自动化"这件事已经被解决了。

ChatGPT Agent Mode:研究和整理靠谱,日程安排一测就露馅

ChatGPT Agent Mode整合了此前的浏览器操作助手Operator与长文档研究工具Deep Research,能浏览网页、操作上传文件、连邮箱文档、填表提交、改电子表格,一个任务通常跑5到30分钟。它表现最好的地方是研究项目、表格整理、重复性表单填写、文档提取;反复翻车的地方是日程安排——独立测评把日历自动化(跨时区、判断会议冲突、订出一个真正合适的时间)列为它最一致的失败点之一。一位测评者对照OpenAI自己宣传的强项(研究、Excel、PowerPoint、综合任务)逐条测下来,给出的整体评分是"大约C"——"局部是真的,但绝不普遍成立"。就连Sam Altman本人发布时都主动加了免责声明:这是实验性、前沿性产品,强大但还不适合高风险任务或涉及敏感信息的场景,用户只该给它完成任务所需的最小权限。(cybernewsaifire.co

Perplexity Comet:65%的成功率,和一个已经堵上的漏洞

Comet于2025年7月首发,起初200美元/月订阅,2026年逐步在iOS/Android/Windows/Mac全平台免费开放。测评结果两极分化:一位早期测试者发现,它做"agent化浏览"大约65%的时候能成功——价格比对、页面摘要这类任务可靠,复杂的多步骤工作流经常失败或卡死。一份30天深度评测说得更直接:这类agent功能"极不稳定",会陷入循环、编造信息(比如订错酒店日期)、有时比手动操作还慢,核心问题是开放网络本身"杂乱、不可预测"——每一个能被agent完美处理的网站,总有另外十个能把它绊倒。但也有一份14天测评给出更正面的结论:比价机票、填慢速供应商门户表单这类具体任务,确实省下了真实时间(总结长技术文档、识别新API平均每次能省约15分钟)。安全上,2025年8月安全机构LayerX发现过一个能外泄个人数据的"CometJacking"漏洞,Perplexity已修复并加了敏感操作前的可视化确认层,Brave Software与Guardio Labs的后续独立审计确认沙盒隔离性有实质改善。(cybernewseesel AI

编程类agent:这是唯一一类真正被规模化信任的agent,格局刚刚洗过一次牌

六类产品里,编程类agent是采用率最高、生产力兑现最明确的一类:91%的工程组织已采用至少一款AI编程工具,市场预计从2024年55亿美元长到2034年473亿美元。Cursor两年内ARR破10亿美元;GitHub Copilot拿下470万付费订阅、90%财富100强企业在用。格局刚洗过一次牌:Windsurf于2026年6月2日更名Devin Desktop——此前OpenAI的收购案2025年7月流产后,Google以24亿美元许可协议挖走了创始团队,Cognition收购了产品本身并改了名字。企业买家的合规诉求成了分水岭:Windsurf/Devin Desktop覆盖医疗、政府、国防等受监管行业(HIPAA/FedRAMP认证),这是Cursor目前还覆盖不到的,但Cursor正在追(新增自托管云端agent,代码与执行留在自有基础设施内)。这场洗牌里冲得最猛的一支是Anthropic的Claude Code(详见本期企业篇),企业编程市场份额已到54%,反超OpenAI(21%)。(daily.devtechsy.io

NotebookLM:从研究小工具,长成了真正的工作流

Google已于2026年7月16日把NotebookLM改名Gemini Notebook,现有3000万用户、超60万家机构在用。它和通用聊天机器人不一样的地方,是"源锚定"——用户上传文档(PDF/谷歌文档/YouTube链接/网页/音频),AI只能基于这些指定来源回答,每条回答都带引用,点开能精确定位到源文档里的具体句子。企业侧已经从试点走到有IAM角色权限管理的团队协作、VPC-SC合规、完整审计留痕、不将数据用于训练。2026年3月的更新新增了幻灯片单页编辑(不用重建整份演示文稿),一位评测者说这个组合"把NotebookLM从研究小玩具变成了真正的生产工作流工具"。一个常见的实际搭配是:Perplexity负责找信息,NotebookLM负责基于已找到的材料做扎实笔记,Claude/ChatGPT负责最终综合写作——三件工具各司其职,没有一个想替代另外两个。(prezent.aijeffsu.org

AI视频生成:画质领先的产品,未必是好用的产品

Sora 2在音画同步与物理真实运动上表现突出,能直接生成对话、音效、环境音,不用后期拼接。但一份30天实测说,最大的障碍是访问门槛(需邀请码)、每日生成上限、20秒时长上限——专业工作流用起来很挫败;只有ChatGPT Pro(200美元/月)才能拿到真正可用的配额(1080p输出+完整Storyboard模式),Plus订阅(20美元/月)权限相当有限;而且它没有内置编辑器,生成的片段只能下载后到别处编辑,这一点上Runway的内置编辑器明显占优。一项非正式横评给Kling Pro档打了91分,Veo 3.1打63分,Sora 2 Pro打59分——评测者认为提示词准确度与画面真实感是Kling最大的优势。Veo 3.1的定位更偏内容创作者、营销、制作团队(需要内置音频、面向广播级商用输出),通过Google AI Ultra(249.99美元/月,含Gemini Advanced)获取。(pxz.ai-30-days-tested),mindstudio.ai

数据表 · 六款产品实测对照
产品场景真实能用的任务反复翻车的任务关键限制
Meta AI Business Agent商用客服咨询/推荐/预约/交易闭环全渠道整合仅限WhatsApp/IG/Messenger,10月起收费
ChatGPT Agent Mode通用研究/文档跨信源研究、表格整理、文档提取日程安排(时区/冲突判断)官方自评"约C",Altman主动免责声明
Perplexity Comet浏览器自动化价格比对、页面摘要、慢表单填写复杂多步骤工作流约65%成功率,曾有CometJacking漏洞(已修复)
Cursor/Windsurf/Claude Code编程全场景,采用率最高格局剧变:Windsurf→Devin Desktop,Claude Code反超OpenAI企业份额
NotebookLM/Gemini Notebook文档研究源锚定问答+可点击引用+幻灯片编辑通用开放式创作需先有明确文档源,不是通用聊天工具
Sora 2视频生成音画同步、物理真实运动专业工作流(无编辑器/时长上限)访问门槛高,需Pro订阅才有可用配额

这条线画在哪:不是聪不聪明,是错了会不会被发现

六款产品覆盖不同场景,评测结论却高度一致地指向同一种模式:有边界、步骤清楚、单一信源或单一网站内的任务(价格比对、文档摘要、表格整理、代码补全、客服问答)表现好;需要跨场景判断、处理开放式模糊性、协调多方约束的任务(日程安排、复杂多步骤浏览器工作流、专业级创意工作流)表现差。这条线的本质,不是agent能力不够强,而是这一代agent缺少对真实世界不确定性的容错判断力——日程安排难,不是因为技术复杂,是因为它要在信息不全、多方利益冲突的情况下做"社会性判断"(这个时间对谁更方便、这个冲突该让谁);Comet在复杂网页工作流上失败,是因为开放网络里全是agent没见过的边缘情况。这和"编程类agent采用率最高"这件事互相印证——编程恰好是一个规则明确、有客观对错标准(代码能不能跑)、反馈循环极快的场景,天然适配这一代agent的能力形态。

再往深一层看,真正决定一个agent产品能不能规模化商用的,未必是任务本身有多复杂,而是这个场景里犯错的代价有多高、犯错之后能不能被轻易发现和纠正。编程类agent采用率遥遥领先,不只因为代码任务"客观",更因为代码犯错的代价极低且极易发现——测试跑不过、代码审查能立刻抓到、版本控制能一键回滚。

而Comet在复杂浏览器工作流上翻车、Meta Business Agent被限定必须允许商家随时接管、ChatGPT Agent Mode在日程安排上被反复点名,这些场景的共同点是犯错代价高(订错酒店日期、传达错误的会议时间、给客户传错信息)且不易被立刻察觉。

这给任何正在评估"要不要把哪些环节交给agent"的团队提供了一个比"这个agent聪不聪明"更靠谱的判据:优先把犯错代价低、犯错易发现的环节交给agent(格式转换、信息聚合、代码生成),对犯错代价高、犯错难发现的环节(对外承诺、财务操作、客户沟通的最终定论)留人类在回路里做最后一道确认。

置信度与局限

六款产品的评测数据都来自第三方独立测评站点,不是厂商官方数据,样本量多为个人测评者数周内的使用体验,方法论互不一致,应视为方向性参考,不是严谨统计。"犯错代价+可发现性"这套解释框架是交叉六份评测后的推理延伸,不是任何一手信源直接提出的框架。Kling/Veo/Sora三者的评分对比来自一项非正式横评,样本方法未知,同样只供方向参考。

参考文献

  1. Dataconomy, "Meta AI Business Agents Go Live on WhatsApp, Instagram, Messenger," 2026-06-04,dataconomy.com
  2. TechCrunch, "Meta's AI Agent for WhatsApp Business Is Now Available Globally," 2026-06-03,techcrunch.com
  3. theaiagentindex, "Meta Business Agent," theaiagentindex.com
  4. cybernews, "ChatGPT Agent Review," cybernews.com
  5. aifire.co, "ChatGPT Agent Mode Review: A 10-Part Real-World Test," aifire.co
  6. cybernews, "Perplexity Comet Review," cybernews.com
  7. eesel AI, "Perplexity Comet Reviews," eesel.ai
  8. daily.dev, "AI Code Editor Comparison: Cursor vs VS Code vs Windsurf," daily.dev
  9. techsy.io, "Windsurf vs Cursor," techsy.io
  10. prezent.ai, "NotebookLM Review," prezent.ai
  11. jeffsu.org, "NotebookLM Changed Completely: Here's What Matters in 2026," jeffsu.org
  12. pxz.ai, "Sora 2 Review (2026): 30 Days Tested," pxz.ai-30-days-tested)
  13. mindstudio.ai, "Sora vs Veo 3.1 vs Seedance 2 Comparison," mindstudio.ai