| |
|
| 知识库 -> 科技 -> 智谱唐杰内部信称「将开启Touch High(摸高)计划,不登顶,就是失败」,如何评价这一宣言? -> 正文阅读 |
|
|
[科技]智谱唐杰内部信称「将开启Touch High(摸高)计划,不登顶,就是失败」,如何评价这一宣言? |
| [收藏本文] 【下载本文】 |
|
晚点独家获悉,今日智谱创始人唐杰发布内部信,阐述智谱对 AGI 接下来竞争的理解。唐杰在信中表示,智谱接下来将继续延续所谓 “反直觉” 路线,开启 “… |
|
123是整个业界所有人都在做的事情,一丁点都不反直觉。4的确反直觉,因为看这个表述似乎是基于可解释性做安全。deep learning已经基于黑箱系统狂飙快15年了,尽管今天人脸识别刷门禁和付钱已经随处可见,算是真的达到了极高的安全标准,但这玩意儿的识别原理依旧是不可解释的。神经网络的可解释性是一个所有人都说很重要,但实践中重要性路边一条的东西。以前也几乎没有人真能基于可解释性反哺安全建设。我不好评价4对不对,但它的确是4点里唯一反直觉的。 第二个感觉是智谱对AGI的定义完全被它的商业化的要求绑架了,这个宣言追的并不是AGI本身,而是通过扭曲AGI的定义从而实现商业化和AGI概念的绑定,实现一种“我说我不在乎短期商业化”的冷艳感,但事实上这就是个短期商业化方向。这也是我们这个行业最喜欢玩的议程操纵把戏。具体点讲,long horizon task和自主智能体系统这俩概念在目前的LLM领域有特指的,基本就是专指用LLM写代码和做文献总结(deep research)。特别是当你看到任何搞AI的人在谈他们在做"独立工作很更长时间的牛逼AI",这样的表述的时候,基本可以100%确定就是在做这俩事情。当他能直接替换程序员/博士生时,我们就宣称达到了AGI。而这俩也是目前比较稳定的能产生商业化收益的领域。因此,只要玩一把计算机自顾自写一礼拜代码/写漂漂亮亮的review=实现自主决策能力的概念偷换,就可以做到名利双收。而且这俩show case的确很炫目,所以通常不会有外行觉得这样的议程操纵有什么问题。 但深耕一段时间后,你会发现,没有人会把long horizon task和autonomous agent system定义成,接管你的资金账户,一段时间之后看能不能跑赢大盘;在你住院时接管内科医生的工作,负责在一定时间内把你治好;充当你的律师,负责在全程把你的劳动纠纷官司打赢。尽管这仨百分百的都是long horizon task,而且是相当重要的长程任务,可能需要多方合作,大概率会是一个智能体系统。但现有的技术做不起来这三件事,特别是后面两件,所以他们被刻意的除籍了。而此类任务和show case的区别,即在于任务执行过程是否干预真实世界。 当你开始问为什么不搞这些干预现实世界的任务的时候,我听很多LLM算法表达过这样的思想:写程序是一种圣杯任务,只要搞定这个其余都不在话下。但这个宣称是有问题的。从2016年alpha go到现在的编程,现在这套实现ASI的RL技术路径强依赖于沙箱,只要你没有沙箱,他基本就不work,off policy到现在似乎也没什么搞的很成功的先例。让AI写一礼拜代码是能挣到钱的事,所以大家才扎堆做这个,而不是因为这是最难的事,也不是因为这是真正的通往AGI之路,大家才做这个。 这其实说明本位面还从来没有人能够建立起对现实世界的模拟能力过。因此我们这个社区很默契的,决定欺骗性的把在赛博世界中实现AGI/ASI视为圣杯,并向全世界营销这种观点,试图把它扭曲成现实。在赛博世界中达到AGI/ASI只是一个现在技术背景下最低垂的果实。只有业界的关注点开始包含了与真实世界的交互,特别是与人的交互时,思考如何在丧失了无限实验权这一先决条件下提升AI的能力时,才是AGI真正到来的前夜。而很遗憾,对于这种现实和我们面对的真实的艰巨挑战,智谱避而不谈。 其实之前一直在试图与现实世界产生交互的是做机器人的和做自动驾驶的,我很看好这些人做出突破性的成果。而现有的LLM厂,很少有公司真的在做这件事。A家在生科领域的投入看上去是最近似能打穿这层墙的,尽管A家反华,还是祝他们好运。 BTW,我觉得ai coding真的是一个很无聊的行业,它至少到现在,没有创造什么激动人心的增量,互联网的高增长早就结束了,但显然已经开始造成了本行业的失业。各个LLM大厂的工程师拿着天价的package,做资本家的伥鬼,真的是非常工贼了。 |
|
评价为磕LLM磕嗨了。 通篇行文基本可以确定是LLM生成,说不定是自家模型。 “完全自我训练”和“极致安全治理”根本就是矛盾的。你想要LLM完全end to end负责训练下一代LLM,那就意味着不接受人的feedback,这就无法做到“安全治理”。你去治理LLM了,那还叫“完全自我训练”吗? LLM行文通常就是这样滥用大词(比如“极致”),却不明白其含义。 > 其三,完全自我训练(Fully Self Training)。在人类高质量数据即将耗尽之际,把算力转化为进化的燃料一一建设高质量合成数据工厂,通过 AI 与 Al 的博弈对抗(Self-Play)实现知识的“无中生有”, 他们确实知道数据已经不够用了,是当前很大的瓶颈。错就错在认为左脚踩右脚真的能螺旋升天呢。 OpenAI和Anthropic 早就以GPT-5系列和Opus 4.7,4.8的广泛差评证明了,合成数据吞多了,模型连话都说得呆板了。Benchmark数字稳重向好,但GPT 3.5/GPT-4那时候的全民热潮般的好评再也没有出现了。 模型厂商这样的自嗨程度,相信了LLM就是万能药,活儿都不好好干了,全都交给LLM vibe(所谓的Full Self Training不就要这样吗),完全丧失了自己的思考和判断能力,然后LLM也只会夸夸,导致自嗨恶循环。 已经有充分的研究发现,泛滥的token账单并不能提高企业营收(卖token的除外),各家企业也即开始限制token使用,26年2季度token消耗已经见顶。 未来的两种前途已经泾渭分明了,模型厂商的自嗨是刹不住车的,而还保有自己思考和审美的用户和企业对模型只会越来越不满,因为吞多了合成数据根本不可能出来啥“智能”。所谓Full Self Training就是闭门造车,只会离用户越来越远。 |
|
昨天用 OpenAI 新发的 sol 模型做了个游戏编程测试。 事情从一个多月前说起。那时候 GLM-5.2 刚发布,我让它干一件事:用 Godot 引擎,自己摸索着复刻一个暗黑破坏神类型的游戏,不给教程,全程自己推进。两个小时后它给我整出来这么个东西: |
|
|
框架倒是有了——等距视角、角色、技能栏、血条蓝条都在。但没法玩,bug 一堆:人物出生点在地图外面,一开局就掉虚空;墙壁贴图乱七八糟,该堵的地方不堵,不该堵的地方全是空气墙;地面贴图全是凸起的,本来该是平地结果跟踩刺猬似的;坐标定位也全拧着。 我想让它接着改,结果发现根本推不动。原因是 5.2 没有原生多模态识图能力,它看不到画面长啥样,只能听我用文字描述"墙壁错乱了""人在地图外"。对人来说一眼就能定位的视觉 bug,它在那盲人摸象。改了一个小时我放弃了。 昨天我又把这个 Godot 项目翻出来,交给 sol 接着修。sol 能看图,推理也强,调试的时候它在日志里这么分析的—— |
|
|
|
|
|
其实思路是对的,它识别出了"实体被画在墙后面"的层级问题,追溯到绘制顺序搞错了,然后去调 z 坐标的层级结构。但三个小时改下来,结果是—— |
|
|
出生点和地面的问题修好了,人物不掉虚空了,地面也不全是凸起了。但墙壁还是乱的,画面还是很简陋。三个小时就这水平,对 sol 这种先进模型来说真谈不上好看。 然后我换了个思路:别死磕 Godot 了,改用 Three.js 试试,还是做暗黑破坏神。 |
|
|
四十分钟,搞定。功能完整,画面合理,几乎没 bug。等距视角、角色、技能、UI 全都有,一气呵成。跟 Godot 那边苦战三小时还修不干净一面墙的惨状比,完全是两个世界。 三个实验摆一块儿,第一个结论其实挺清楚的:Three.js 这类东西跑在浏览器里,DOM、控制台报错、截图全都能自动采集,天生适合做 RL 的环境闭环——AI 写一版立刻就能"看见"对不对,再迭代。Godot 是桌面引擎,渲染管线、节点树全关在编辑器里,想自动跑、自动截图、自动反馈,闭环很难低成本搭起来。数据多的领域 RL 做得充分,AI 就强;数据少的领域 RL 做得少,AI 就弱,哪怕 sol 这种先进模型也一样。这条链路基本能解释 AI 在不同技术栈上的强弱分布。 但把这个结果思考推广开去: 现在 AI 已经能做到什么了,数学满分通关 IMO,连埃尔德什那种级别的问题都能解;编程上称霸各种竞赛,IOI 信息学奥赛把人类选手全打趴下了;工程上四十分钟做个能玩的暗黑破坏神 demo,同样这活儿让资深程序员干少说也得两三天。 一个数学、编码都站在人类巅峰、工程能力也这么猛的"存在",你敢信它调一个相对陌生的游戏引擎能死活调不好吗? 换成人呢?一个真懂数学、懂编码原理的程序员,哪怕从没碰过 Godot,给他两天熟悉一下节点系统、信号机制、Y-sort,凭着在 Three.js 里攒下的 3D 渲染和坐标系理解,很快就能上手。因为底层原理是通的——坐标系变换、深度排序、绘制顺序、碰撞检测,哪个引擎不是一回事? 但 sol 做不到。除非你在 Godot 这个领域大量合成数据、清洗筛选、再跑一遍 RL。你就算拿 Godot 数据把它训好了,这能力也迁不到 UE、Unity 上去。 我觉得这只能说明一件事:LLM 其实并不真正懂数学,也不真正懂编程。它只是在训练数据里找到了数据模式,然后在这些模式上做拟合。它的"泛化"本质是对已有数据模式的拟合和组合,不是人类那种从第一性原理出发的跨领域迁移。 它有了数学能力、编码能力、会用 Three.js 做游戏,但这些能力是各自孤立的拟合结果,彼此之间没有真正打通底层。Three.js 迁不到 Godot,Godot 迁不到 UE 和 Unity,就是因为这些领域在训练数据里是割裂的,没有一个共享的"原理层"被模型真正抽象出来。 人正好反过来。人明白了"深度排序本质上是按 Y 坐标决定绘制顺序"这回事,换到哪个引擎都能立刻用。AI 掌握的是"在 Three.js 里这么写就对"这个模式,换到 Godot 就得重新学一遍。 这个缺口能补吗?理论上行。持续学习让模型在线修正权重,或者让 LLM 自己合成数据、自己跑、自己筛选清洗、自己做 RL 快速迭代,把更多领域覆盖进去。确实能让能力版图越来越广。 但得清醒地认识到,这依然不是人类的学习方式。人是"一窍通百窍通",理解一个原理就能举一反三迁到所有相关领域。AI 的补法是一个领域一个领域地堆数据堆 RL,靠的是覆盖,不是理解。人学会骑自行车就能迁移到骑摩托车,AI 得把摩托车也单独训一遍。人学了欧几里得几何,那种思维方式会渗透到编程、到设计、到一切需要逻辑的地方;AI 的几何能力止步于几何题。覆盖得再全,也补不出"一窍通百窍通"那个跃迁。 所以这次实验让我对 AI 的"聪明"有了更冷静的看法。它在数据充沛的领域强到吓人——IMO 满分、竞赛封顶、四十分钟做出可玩 demo。但在数据稀疏、闭环难搭的领域,它会卡在人类觉得"根本不该卡"的地方,比如修不好一面墙的贴图。这种割裂恰恰暴露了 LLM 的本质:强大的模式拟合,而不是真正的原理性理解。它的边界不在于"智商不够",而在于数据没覆盖到的地方,就没有第一性原理能给它兜底。 这可能也是下一代模型真正得突破的方向——不是堆更多数据,而是让模型学会"理解"这件事本身。 |
|
都2026了,完全自训练这个卫星怎么还有人要放? 两个小学生唠嗑,越唠越聪明,最后双双唠成大科学家,你信吗? |
|
刚融了 300 亿,还是折价融资,立马就能出售的股份。 总不能跟大家说,我是在和机构一起诓散户钱吧? 我觉得智谱下一步的研发方向是比较明确的。GLM 5.2 已经证明了智谱在 Post-training 上的能力和成效,商业化上也证明了,只要你的模型能干活,就能够拿到不错的商业化成绩。 但是 GLM-5 毕竟是一个不到 1 T参数的 base 模型,下一步肯定是要继续 scaling,包括长上下文也是要进一步扩展的。 继续拉近和 OpenAI 与 Anthropic 的差距,做更大的基座模型和上下文窗口,投入更多的资源来做后训练,都可以称为“摸高”。 至于说 AGI,说实话,我觉得在 2026 年,大家已经没有那么痴迷于这个词了。 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
|
| [收藏本文] 【下载本文】 |
| 上一篇文章 下一篇文章 查看所有文章 |
|
|
|
|
娱乐生活:
电影票房
娱乐圈
娱乐
弱智
火研
中华城市
印度
仙家
六爻
佛门
风水
古钱币交流专用
钓鱼
双色球
航空母舰
网球
乒乓球
中国女排
足球
nba
中超
跑步
象棋
体操
戒色
上海男科
80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联 |
| 网站联系: qq:121756557 email:121756557@qq.com 知识库 |