会用电脑就算 AGI 吗?——《词元之外》Weekly #002 讨论整理
会用电脑就算 AGI 吗?——《词元之外》Weekly #002 · Jason · 2026-09-13 · Next Token, 播客, AI, Agent, iPhone Duo
来源: Next Token|词元之外 Weekly #002 原题: iPhone Duo 发布,Astra 算 AGI 吗? 录制: 2026 年 9 月 12 日,上海 AGI Bar(北杨店) 当值: 向阳乔木 在场: 向阳乔木、歸藏、橘子(冯雷)、杨攀 音频: 小宇宙这一集 (约 1 小时 43 分) 节目主页: nexttoken.tv 下面按节目顺序整理当场说了什么。体验、数字和预测都是圆桌上的个人判断,不是对产品的独立评测。转写有几处听不清,文中标了「转写不确定」。 --- 开场 第二期仍按上期结构:先模型,再 Agent,再硬件,最后闲聊。 乔木报了上期成绩:发布当天小宇宙约 400 多订阅;录这期时播放约 3000+;B 站浏览约 1 万。感谢「大聪明」和南乔把场地放到 AGI Bar。 上周大家绕不开的模型是 GPT-6 Astra 。点评按惯例从歸藏开始。 --- 一、Astra:强在 3D,省 token 的原因是写代码,不是点界面 歸藏这周主要拿 Astra 玩 3D 和建模。理由很具体:各类 benchmark 已经到 99%、100%,终端用户没体感,只能去卷更直观的 3D。以前演示还停留在「画皮卡丘骑自行车」一类 2D / SVG;现在案例几乎全是 Blender 。 他发过一个 3D 小游戏,自称只用了额度的 3% 。小红书评论区不信。他核对后确实约 3%;再扩成无限地图、刷怪升级、选技能和武器,又多 2%,合计大约 5% 的 200 美元额度 。有人微信问他:为什么自己的 200 美元很快烧光。 和「黄老爷」讨论后的判断:很多失败不是模型不行,是需求没有工程化。有人要「一整颗星球」。游戏实际是分区加载、有边界、五六个场景拼出来;模型和人都不可能按真实星球面积去建,于是过度消耗、结果难看。即便如此,他们仍认为 GPT-6 在这件事上很强。 关键机制:不是 Computer Use 在点 Blender 按钮。模型用的是 Blender 自带的 bpy 。界面长期停在欢迎页,过一会儿打开已经建好。再加 Blender MCP,截图看结果即可,token 效率高,所以用量少。做游戏用 Godot 也有类似路径:做完一开就有,没有逐步点界面。 上期观点被再讲一遍:接下来的软件要拆成两套——一套给 Agent 调用、把效率做到极致;另一套给人看内容。上周达芬奇剪辑出了 MCP,能力拆开可被任意模型调用。付费策略被表扬:付费版才给 MCP,免费版不给。不是绑死一家 AI,而是「你花钱,我才让你接别的模型」。 歸藏侧产品(转写里是 Cola)也接了 Astra。用户并不热衷,原因是 太贵 。用量和对照模型差不多(转写里是 Fable / 飞波一类,未钉死是哪一家)。 coding 并不明显更好。 Astra 相对领先、他们比较有把握的,是专门训过的 3D。 --- 二、他们自己怎么用 Agent 做这档播客 问杨攀用了 Astra 的哪些能力。 第一期发布(含官网)几乎全用 Astra / Codex。贵,但省 token、效率高,同级任务以前要想很久。他现在用 Astra Medium 。Codex 不选模型时走 Default:底层从 Soul Medium 到 Soul High,再到 Astra Medium。理解是 Soul 两档,下一档就是 Astra; Astra Medium 和 Soul High 一个定位 ,默认没有 Soul High。手感:话很少,干活极快。 卡点仍是人:耽误的时间全在 human in the loop。现场录音软件他不会用,也交给 Agent。 有人把「电脑和 Codex Agent 一体、Agent 会用这台电脑」说成巨大一步:从 Astra 起,电脑整个都归它了。从操作电脑的角度,有人说「已经是 AGI」,操作水平「运筹我们」。 具体成果:以前自己写的 ROS 软件一直懒得上架;这次交给 Computer Use,提交了 两个 ROS 应用 ,以及两个 Obsidian 相关上架。播客全平台发布——小宇宙、B 站、Spotify、Apple Podcast、YouTube——杨攀称这些平台自己以前都没用过, 全是 Codex 自己发布 ,他只准备素材。 新的「套利」不在写代码,而在一个人维护五个播客后台这种手工。网站上 transcript 带着他们的 ID,有人做一年、有的软件年费 VIP 都没有,他们说 两天做完 。实验场是 nexttoken.tv 。火山、阿里这类后台以前像迷宫,现在也能让 Agent 去点。 对外宣传强化的是 3D + Computer Use。为什么 OpenAI 这条明显强于他家?上期提过:大约 2024 年收了一个做电脑视觉识别 / 空间操作的小团队 ,估计这两年一直在做。另有新闻:新 Mac 发布后 GPT 方面抢购苹果机器,有人说到买了约 两万台 ,估计和训练有关。 路线被说成两条并行:OpenAI 把 Computer Use 当成 coding 之后的通用 primitive,「等不及软件改造,先让模型用旧软件」;同时软件自己也在出 MCP。有人冲了某剪辑软件年费,用一分钟觉得太难用,退回 Codex + ffmpeg ;上期视频也是 Codex 剪的。剪辑被认为有被颠覆的可能。 --- 三、会用电脑,就算 AGI 了吗? 有人直接问:GPT-6 算 AGI 吗?能感知到吗? 一方:看定义。某种程度上,我能做的很多事它能做,我做不了的它也能做。 反驳:按这个标准,很早就 AGI 了。 另一方:比大约 90% 靠电脑办公的白领 强很多。个人体验里挡住它的,是「旧世界」的平台和流程(点名了一个平台,没说名字)。 写作和评测被顺手提:有人说某代 5.1「没人愿意比了」;「飞博」现在都在 Cursor 里用。写作上 Gemini 3.8 Flash 有人觉得还不错;中间一堆 Claude / 他家模型不太行;5.1 写字很好,可能是那家最好的。 Benchmark 被说已经刷烂。有一套偏编程的 2.0 / 3.0 / 4.0 评测:各家 2.0、3.0 都很好, 4.0 掉得很厉害 ;只有 Anthropic 一侧在 2–4 上没有断崖。点名 Terminal Bench :题变难后对照模型断崖,并称对照和 Astra 都应是最新一代。 写作专长被单独列了一段: 以前写得最好的曾是 Opus 4.6 (也有人说 4.5)。 现在有变化:有人整站内容换成 Gemini 3.8 Flash;再加上橘子说的 Fibre / 飞波 5.1(转写不确定)。 写得好的「居然也都是海外模型」。Kimi 3 稍好一点,但大家都去卷 coding,「没人关心」写作——有人说这很不好。 GPT 写作很差 ,被特意点名。写小说从 GPT-5.5 起也能写了;国内模型几乎没有能写小说的,还越来越差。有人猜和逻辑 / 思考深度有关。写中文网文:Obsidian / GPT 都可以了。 --- 四、DeepSeek Flash + Harness:够快之后,瓶颈换成人和交付 中文信息检索被强力安利: DeepSeek Flash + DeepSeek Harness 。若要在中文世界「解锁信息」,这组合被说成天花板;前面说的海外模型和工具都不行。微信公众号、千问类内容,靠 Harness 里的插件才能拿到别处拿不到的东西。查数据时尤其明显。为什么必须配 Harness?现场的回答是「不知道,反正组合好」。 对专业程序员: 4.1 Flash 很快出结果,因为人有判断。可能初稿 67 分,半小时调到 95。评价是:对专业 coding 还挺高。 趋势:他们原来信仰 SOTA;Flash 风潮后各家都出 Flash,感觉已经 越过一条能力线 ——线之下都 OK,SOTA 留给更复杂任务。 Harness 刚出来就能通,但更新极频:以前装的插件大半不能用。歸藏以前给它做过 GUI。评价:组合强,但 一天十几个版本 ,一更新就动插件核心,所有插件废;做 GUI 更惨,挪个位置界面就废。结论:只能做 MCP 或 CLI。被比作 Linux 早期:要稳就等别人打包,要折腾就跟官方走。 缓存被反复夸:在 Cola 里和它「没有任何合作」,缓存率也能到 99% ,现场看到 99.5% ,有时 100%。别家到 90%+ 就不错。这一代又优化 KV cache(约 4 倍),核心参数大了一倍但价格相当于降了;激活参数只剩 8B ,还能动态改 system prompt 且不影响缓存。有人没看论文,觉得像黑科技。 设计侧反馈:这模型 太快了 。以前不觉得快重要,现在「快 10 倍太重要」。Flash 降价约 50%。V4 Flash 加了视觉。Flash 仍有一点独立思考,而且「不谄媚」:有人昨天被它喷「你说的不对」,纠正半天,模型说「我仍坚持论点,但我可以帮你写」——被认为对齐很强, 谷歌到现在没掌握 。 副作用:快了以后无形消耗变多。有人强力用 DeepSeek V4,一天能花 200 块 。人没反应过来、没停,它已经做完并走向完全不同方向。 新卡点不在写代码:要启动多环境、测试、对比、打包。发一版走苹果审核 50 分钟起步 ;开发 10 分钟,发版半小时到一小时。歸藏说自己的 Cola MD 开发版都懒得发,扔仓库谁爱装谁装。 --- 五、模型路由:用户到底在买哪个名字 有厂商把旧 V4 Pro 路由到 V4.1 Flash ,后又撤回。有发言权的人说:不是这次才这样, 2025 年他们全是这么干 。以前 DeepSeek 对外就两个名字(Chat / Reasoning),背后换版本不通知、名字不变,调用行为却变了。网友吐槽:提示词写好了,模型换完就不灵。 此人 2025 年蛮站「模型滚动升级」; 2026 年不完全同意 ——提示词在产品里占比越来越小,好多内化进模型。第二,他们后来也开始听群众意见。 命名:正常应叫 DeepSeek V4 Flash,后来没有 V4 了,叫 DeepSeek Flash ;以后会走两个系列: Flash 和 Pro ,版本号滚动。各家都开始滚动(豆包也要),因为成本多在后训练、会一直训。 反对无声替换的硬理由:两模型 定价不同 。后面有大量 2B 客户一起调价,调完三四天又滚回来。若官方不愿赚 2B,让第三方去挣也行;但第三方延迟可以是官方的 100 倍 。想好好用就用官方;官方体验可能领先阿里 / 火山「一年不止」。谁能提供接近原厂的速度和体验,流量就过去。 --- 六、Agent 需要一台常驻电脑 上周聊了 Grok Bot ,Meta 出了 Muse 。感觉「返璞归真」:起源于 Chatbot,现在又回到 Chatbot。过了一周,共识更强。 核心论点:若 Astra 的 Computer Use 是 AGI 的窗户纸, 接下来 Agent 若没有自己的云端电脑,就差了一代 。这会极大增加厂商成本。早期为抢用户可免费送;以后有电脑 / 没电脑的 Agent 定价会拉开。Grok Bot 没有免费额度 ,一来就起机器、就是成本。Muse 更个人向,理解是免费也能用,定位像「美国豆包」。 豆包 / Gemini 日活高,必然走向两个方向:要简单(Agent 很复杂,豆包工作台打开,50% 人看不懂「连接器」那行字),以及必须能在 手机 上用。电脑端 Agent 难推广。用过云端电脑和没用过的人,认知差一代。 不愿把东西放云电脑,还有别的路:Cursor 出了对标、偏企业的版本,能把 自己的电脑托管成 Agent 可控主机 。理念:必须给 Agent 一个完整运行环境,再分任务。这和原来只用 Claude Code / Codex,差异会非常大。 Devin 估值被重提,因为他们最早有云端电脑; Manus 用完那套之后做出来,也是最早给用户云电脑的。然后接到 OpenAI 出了 Agents API 。 有人没试 Agents API。理解:相当于把官方 Agent Harness 打包,团队不用自撸闭环。上半年每家都在撸自己的 Agent;下半年收敛:一边是 OpenAI 这种 Agent API,一边是 DeepSeek Harness,稳定后会形成共识、很多人二次开发。 问歸藏:小团队该选什么框架?歸藏:大家现在只要「壳」;loop、模型适配肯定搞不过官方。最早共识是「可乐的扣子」(Coze 一类)。后来变成套利:哪个框架 / 渠道更便宜、能力更好就跟哪个。于是 Cursor、Grok、Claude Code 都要配,冗余极多——有的 SDK 已经很好,本该只管 UI,实际还要做 runtime,把用户输入灌进不同 CLI,还要消化各家只支持自己的 API。 Cherry Studio 、 T3 Code 都在做这类活。越做工作越多,又不能只配一家:今天 Claude 不行了、额度又卡,就得切。 相反观点(上期也提过):以后厂商的 Agent 框架会和自己的模型 绑越来越死 ;完全中立的 OpenCode 会是独立小赛道,但更大趋势是「用谁的 Agent 就用谁的模型」。万能壳会越来越难受。 有人把 Agent Harness 比作未来的阿里云 / 火山云:不再按「调模型」,而是按「调服务」。以前租 AWS / 阿里云主机部署程序;以后更多是租 Agent 主机 / 环境 。过去一年把 Agent 当产品做,其实 Agent 是技术不是产业。海外个人 Agent 已经不告诉用户什么模型——用户甚至不必知道背后是 Agent,才叫产品化。 模型和 Agent 被说成盒与互补:模型不好,Agent 带不动;模型好,带 Agent 相对容易。个人观点「原汤化原食」:各家 Agent 能力差不多,发模型肯定补贴自己的 Agent(含 KV cache 优化)。连接邮箱 / 日历 / 购物 / 支付 / 健康,谁都能做。 --- 七、垂直应用:数据、接口、上下文,不是再套一层对话 近期觉得比较好的是 阿福 (医疗)。同事有小毛病都去问:专业知识细,手上长包这类问题比通用模型更具体。上期逻辑被复述:价值在 数据、能力和开放接口 ,不是套一层对话。例:WorkBuddy 炒股能做炒股软件里做不到的事,因为厂商开放了接口。 购物:让通用 Agent 代购搞不定;在淘宝 AI 里让它买,比通用强很多。 飞猪 做旅行明显更好。阿福和飞猪已经「快能用」;千问这类办公 Agent 还只能整办公。因此怀疑并不存在真正的通用 Tone Agent:Manus 自称 Tone Agent,让它做短剧也做不了。 微信 小微 机会最大——每个小程序都是能力接口 / MCP。例:携程有小程序。若小程序能对上小微,就可以在微信里下单。他们试过:让小微调某个群发一条消息。关键:小微 长在软件里 ,不是另开一个对话窗,而是基于你的上下文和软件能力直接操作。界面上「在联系人列表里」非常重要。 王登科 做的 The One 直接爆了。问题是微信回调约 10% 收不到消息 。为何不做独立 App / 网站?因为用户就喜欢待在微信好友列表。它甚至不是 Agent,就是 chatbot,但扫码即聊把转化做高了约 6 倍 。普通人很多问题一个聊天机器人就够。 微信、百度、豆包办公、千问都被说成中间形态,为了拿 Computer Use 数据训模型,也赚不到什么钱。微信只要提供一点能用的,大家很难懒得再开别的。例子:本该去 DeepSeek 或 ChatGPT 的问题,结果打开微信搜一下小微按钮,答案凑合能用。很多人不需要工作 Agent,需要的人会越来越少。 小红书 点点 也被说很好用(查游戏攻略等),被认为是小红书最好的 AI;和微信小微同构,但小红书数据质量更好。点点会总结「30% 的笔记推荐这款」,比例很准。平台又特别敏感,稍微自动化就封。 --- 八、iPhone Duo:他们关心的不是能不能折,是标准 后半场转到硬件。以前常熬夜看发布会,这次有人看第二天 24 分钟剪辑。 有人发了刘飞介绍折叠屏历史的播客:七年前就有折叠屏,苹果一出又像新发明。翻开时的透明视觉在 X 上传疯。判断:苹果是家 交互公司 ,核心是 UX。iOS 更新常被嘲「雕花」。但真做新形态时, iPhone Duo 上的交互优化被称天才 ——折叠展开动画,国产(直折 / 左右折 / 三折)多年都是生硬切换、白边、闪一下;适配则一股脑扔给厂商「按我的比例改 UI」,或用人肉谈合作。 苹果适配也难、成本明显,但界面策略被认为聪明:把上下 bar 都放到右边,展开后左边内容比例仍接近原来的竖屏,只是上下显示更多;用官方组件的 App「挪过去就能用」,自定义太多才要自己扛。有人说:交互设计「看了就很爽,所以值那么多钱」。 橘子一侧被总结成 Duo 定义了三件事 (现场有人说「橘太会吹了」): 1. 定义了折叠屏形态。 以前各厂不坚持同一型号,直折 / 三折乱换;苹果定标准后,小米、OPPO、华为都知道怎么做。磁吸配件都去适配苹果。这次交互被说成「四五年最大一次更新」,领先国内一年以上。 2. 定义了交互。 3. 定义了生态 / 适配面。 开发者以前难适配是因为每家不一样;现在大约 6 种界面 (盖上、掀开、半折等),适配好这 6 个,未来五年就够。安卓也会跟这套标准。「伟大的公司定义标准。」 橘子自称对折叠屏不感冒,但听完库克相关采访有感:库克上台那年发了 Siri,2022 年 Siri 仍差;Car 项目十年两千人没做出来;Apple Vision 失败——大公司出创新不容易。折叠屏可能是苹果这些年 唯一真正的新品 。原本觉得 iPhone Air 手感好、想等二代,估计 Duo 出来后超薄那条线不会再出;也有说法 Air 做那么薄是给折叠做技术储备。 杨攀:从 iPhone 发布到现在,屏越来越大、使用时长越来越长,面积上能表达的内容没有尽头,已不够今日内容消费,所以主流会把屏做大;屏不能无限变砖, 折叠是必然趋势 ,展开后才有更大交互 / 消费面——「下一个五年的新趋势」。 苹果 AI 几乎没提。有人举 Siri:运动记录要不要记下来,最后只是写进备忘录, 没有 memory ,还是 2023 年前的感觉。Siri 迭代约 15 年一直差。解释:一是模型,二是苹果极度注重隐私,AI 和隐私 / 安全存储 / 云端加密缠在一起,没想清楚不会下手;它毕竟是消费电子公司,不是模型公司。 歸藏已买「米多」(小米折叠)。安卓适配极难:超级 App 界面多到自己都不知道,再乘 6 种形态「非常恐怖」;国产爱魔改,没有一家能定义标准,只能跟苹果走。同时软件越做越潦草,没人花一两年打磨交互。有人吐槽机场里国产银行 / 证券超级应用经常点不到、下不了单、支付一周修不好。 --- 九、手表、录音、健康:便利和隐私绑在一起 发布会还有手表 AI。做录音卡的公司被说「瑟瑟发抖」,但功能主要是 总结 ,不是完整稿。以前极客在手表上做录音,常被喷音质不如录音卡;苹果官方推了,硬件(更多麦克风)+ AI 降噪被认为能解决。处理偏本地(经 iPhone)。好功能:没听清可 回放 15 秒并出文本 ——餐厅服务员讲 15 秒听不懂,一按就有文本,后面还可能翻译。 认为社会默认规则会往「可以录」推进:现在还要问可不可以录、别人不舒服,慢慢会变。另一角度:人人都有点 ADHD、信息太多、记忆力退化,越来越依赖设备。有人 Apple Watch 好多代没换,因为这个功能打算换一块。 健康:Watch 拿了太多个人数据。心跳采集速度提升约 60 倍 ;精度被说到接近某些医用 / 胸带。骑行游泳也在广告。有人提一款没屏幕的手表、用 Google / Gemini 分析睡眠,按建议做深度睡眠大幅改善。手表健康数据「还没被真正挖好」。 Oura 戒指 完成度也很高。 有人唯一定时任务是 ChatGPT 的健康相关 GPT:力量训练有文本记录。一段健康故事(转写中段有缺口,后文拼起来):有用户病了约十年,各科看不出。把十年症状和每次犯病经历交给 Cola,Cola 推出可能的药;带着建议问医生,医生说「还真是,你试一下」,后来治好了。更完整的版本是:还要按它指出的方向去医院做检查(物理世界检查只能医院做);检查完医生的判断方向、后续治疗策略和 Cola 完全一致。结论:AI + 健康能帮上忙,闭环仍是 个人数据 / 个人 context ——context 越大,AI 能帮的越多。节目自己也声明:这是个人体验交流,不构成医疗建议。 很多人用飞书「录音豆」尽量录;有朋友用大半年电池快坏,家里硬盘备份爆了。闲鱼买全新还送 6 个月会员,每半年换一个约 500 多,觉得值。 回到上下文为什么可惜:Grok Bot 海外把商业 MCP 都打开了;国内只能在小红书用点点、微信用小微,「各家都不开放」。 快讯被顺手提:豆包输入法 Windows 版;通义一类更新 Agent 合并企业能力;海外 Suno V6 、 ElevenLabs 和环球音乐的合作「都没了」。赛道已分清:编程向是 coder,办公向是豆包工作 / 千问办公,WorkBuddy、CodeBuddy 队列对齐。有博客说大厂内部赛马阶段性结束,开始跟外部对手打。国内共识不太做 to-coding:程序员约 1000 万 vs 办公约 1 亿,上限太低。 --- 十、音乐、图像、设计 Agent:没有执行环境,就还差一代 Suno V6:音质没大变化,老问题还在;要解决的不是「能编辑」,而是加了 Agent ——Studio 里可用自然语言改。有人讽「音乐行业离缅神又差一年」。 图像:参考图连续生成十几张,人会轻微漂移;新版本号称连续改 11 版「别的东西一个像素都不动」,但人不动、背景拖影 / 破碎 / 变黄的老问题还在,「还是不能用」。有人用 Codex 不用生图工具、用代码画出来 。点哪改哪,像素理解准,美学仍差。3D 变强;演示画立方体、按轴旋转不再乱晃,连续编 64 帧看起来像视频。再让 Codex 拼 GIF 就是视频。上周做了把旅行照片变成海报的图片 Skill,想把这些能力接到设计工具上。 设计类 Agent 仍有「隔离」:很多垂类 Agent 没有编码能力 ——底层其实能编码,产品层不给。排版时他要先写 HTML,用 HTML 做文字网格。点破:有些 Agent 没给你 runtime ,主动限制编程;不一定是安全,就是没做。Agent loop 最基础就是环境;编程是基本能力。 市场上同时存在好几代:最先进的已经整机给你;企业侧「Prompt + AI」这种最古老的也能解决大部分 2B 问题,可以原谅; 做 AI 产品的人不能停在那儿 。他的提示词里有很多图:最终产物用四张图 + 一两千字提示——原图、前端生成再截图的排版图、参考图等,还要文件系统。图能传、skill 能伸出来,但调不了图链。这 skill 其实是为 Claude Code 和 Codex 做的。结论:不论垂类与否,Agent 都应有编程 / 文件 / 参考图这些互补能力;GPT-6 在 Blender 上就是用编程建模,做设计同样需要,但现成产品没有。 豆包工作等也有虚拟机,但是 临时的 :每次拉起另一台,不同对话不同 VM,上下文不持久。Kimi 以前也这样,国内基本都这样。成本低,带来的问题是「那东西没有用」,不是一代产品。国内找不到能对标 Grok Bot 的竞品。 --- 十一、语音输入:准确率不是最大的摩擦 还在用语音输入。这周网易有道出了免费、自称永久免费、对标评测的产品,奔着 Typeless 去。有人电脑上 Typeless + 微信内置,手机上豆包。 豆包电脑端被批没做好「输入法本身」:一打字就错,连续错四次就想卸。被疑不是成本而是管理 / 优先级——先做语音、冷落打字。iPhone 上语音输入法不行、要切全键盘;豆包在 iPhone 上「一直启动」也接受不了,所以 iPhone 上几乎没法用语音输入。不用 iPhone 的两大理由:电量,以及已经习惯语音、空格却跳转。微信输入法有麦,电脑微信新增 长按鼠标即可语音输入 、不挡其他输入法,符合直觉但提示「有点烦」。 Typeless 核心是长文本优化和梳理;豆包要么过猛要么几乎不做去重 / 排版 / 去掉口头禅。Typeless 有段时间很拉,现在很好;写长东西基本靠语音。认为转写各家都还不错,没有本质差异。 --- 十二、模型真的变笨了吗 乔木一直不理解:模型刚上线特别聪明,过一段时间变笨,都说「降智」。在 X 发帖,点赞最高的回复给了四种手段(不知是否研究员): 1. 路由到小模型 ——简单题用小模型;「你觉得很重要」也可能被判简单。 2. 社区逆向 GPT 发现的某个内部值(转写作 Juicy):5.5 刚上线约 700 多,后来调到约 120,低了约 6 倍,思考 token 变少。 3. 提前结束思考、直接输出。 4. 多 token 预测多路答案,调概率让小模型结果被选中,省算力。 有人觉得偏阴谋论:自己很少有这种感受;如果预设厂商有原罪,就会处处觉得在降。从厂商角度:内部 Eval 很严肃,口碑当回事。Claude 和 GPT 出过几次,用户投诉后查出 bug 再修复「又恢复了」。也承认可能有策略:检测到异常 / 薅羊毛会主动降智——「对国内感觉更明显」。 另有人:每个模型都会变差的感觉,有时是正常换代。 Opus 4.6 被说官方先降智, 亚马逊 / AWS 版本一直没降 ,更贵但稳。和别的模型商合作也发生过问题,不是故意,发生了改就好。 如何判断模型:benchmark 和报道看一眼,不当标准;加很多社区群,一周看反馈——主观表达 + 更客观的 adoption / 利用率 。没人用就甭说。Claude Code 上次那个 bug,社区不反馈「一辈子也不会改」,改了一个多月,是口碑实在太差。说明仍非常早期:稳定、低延迟、智商到位的模型很少。模型生命周期短,能用的要么顶格要么 Flash,中间一堆尴尬;「斩杀线之内」对用户没意义。 --- 十三、Mistral、Kimi,以及「模型训练模型」 欧洲 Mistral :两三年前做 Agent 用过,最近又融了一笔。有人认为「欧洲主权大模型」没戏,存在价值只是欧洲需要一个,好不好不重要。全世界只有中美有能力做这事。 Kimi:有「微调 2.27」一类版本;Kimi 3 都出了还在微。昨天奇怪版本号: Kimi 2.8 ——从版本号看肯定不是 K3 架构。K3 尺寸很大、费电、质量高。各家都出 Flash,Kimi 按说该出 K3 Flash ,结果不叫 Flash,估计内部资源 / 产品节奏搞不出 K3 Flash,又要低成本更快,可能用更旧架构做了一档。Flash 命名也怪:最早 Gemini 发明这档,本意是快(提到能超 100 token/s),实际是小参数,现在也不小。有人说 Gemini 是 Flash 比 Pro 强,DeepSeek 也类似,和「新骨架 + 后训练变强」有关。后训练周期突然变短——「圈子没有秘密,一家突破周末 party 大家都同学」。中国是不是被逼出很多黑科技,有人特别同意。 有两家已进入拐点—— 用模型的智能训练模型 ;「我们还没越过」。很早都在说「模型训练模型」,「只有 OpenAI 和那家做到了」。吓人处:美国若先越过那个基点,就可能追不上。 另:Anthropic 员工辞职、1.5 亿曝光,认为 OpenAI 和 Anthropic 内部没有阻拦 AI 发展。有人 2023 年线下分享最后一页就是:个人信仰五年内 AGI;五年后两种可能——更美好,或没法描述。接到 Anthropic 就业 / 经济报告:推演未来约 5 年 AI 影响,最乐观 GDP 约 +30% ,白领工资几乎没变(约 +0.5%),收益率约 +80% ——资本和 GDP 结合、不需要人也可以增长;这两年增收最大头被资金拿走,全球 GDP 在涨、生活没变。 --- 十四、从代码到实物 由 Astra 的 3D 想到:建模好了之后, 3D 打印机易用性会上台阶 。以前要上料、建模,只能用社区现成模型——比如把 iPhone 卡进闹钟的件,作者是 iPhone 18 你是 15,改不了模型;现在很容易。切片软件、上量、支撑怎么抠,都「不用玩了」。以前是「口喷在数字世界里创作」,现在是「口喷在物理世界里创作」。前几天试 Rodin 觉得很好。 感慨具身 / 物理世界 AI 还慢;也有人说慢有好处。办公「再过两年可能没有办公」被随口说到。机器人:宇树上市后的市值,被当成阶段性高潮、挤挤泡沫。然后饿了,吃饭,准备结尾。 --- 收尾 感谢上海 AGI Bar;北京也有。希望全国都能录。第二期到此。 片头片尾音乐:Scott Buckley 的 Electric Dreams 和 Origami (CC BY 4.0)。 --- 圆桌上比较清楚的几条分歧和收敛 1. Astra 算不算 AGI: 会用电脑、能完成真实任务,一方觉得窗户纸已经捅破;另一方说按这个标准很早就算了。共识更接近:比多数白领强,仍被旧平台和流程挡住。 2. Agent 差在哪一代: 没有常驻电脑 / 持久环境,就差一代。临时虚拟机不算。Grok Bot、Devin、Manus 被放在「有电脑」这一侧;国内多数还没有对标。 3. 小团队还要不要自撸 Harness: 歸藏认为只要壳,loop 搞不过官方;另一边认为厂商会把 Agent 和模型绑死,中立壳会越来越难受。 4. 通用 Agent 是否存在: 购物、旅行、医疗都是垂直数据 + 开放接口赢;微信小微、小红书点点赢在入口和上下文,不在「更像 Agent」。 5. 折叠屏: 橘子强调苹果定义标准;杨攀强调屏不够用所以折叠是五年趋势;歸藏已买小米折叠,吐槽安卓适配和国产超级 App。 6. 模型降智: 有人列出路由 / 砍思考预算等四种手段;有人认为预设原罪就会处处觉得在降,更多是 bug、换代和国内渠道策略。 --- 根据 2026-09-13 小宇宙音频转写整理。转写用 faster-whisper,约 08:28、18:19、35:15、46:21、58:15、70:07、76:08、90:31、96:37、100:34 等处有缺口或串音;Fable / 飞波 5.1、Cola、Juicy 等专有名词以现场语境校正,仍可能不是官方名称。