| |
|
| 知识库 -> 科技 -> 如何评价腾讯7 月 6 日发布的混元 Hy3 ? -> 正文阅读 |
|
|
[科技]如何评价腾讯7 月 6 日发布的混元 Hy3 ? |
| [收藏本文] 【下载本文】 |
|
7 月 6 日, 腾讯混元 Hy3 正式发布。相比4月底发布的 preview 版本,Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等生产… |
|
短的结论:直挂云帆济沧海 基本情况: 两个月,是目前国产模型更新一次的版本的平均耗时,略慢于北美顶级团队,略快于有硬骨头要啃的友商团队。两个月足以让智谱完成了从 GLM-5.1 到 GLM-5.2 的跳变,一跃飞升世界顶级模型之列。而腾讯用了两月只是让模型去掉了Preview 这个词吗。 从推理性能来看,正式版一举超过了同 Size 档位的 DeepSeek V4 Flash 和 MiniMax M3,达到了目前在测的中小尺寸模型最优,极限能力也能越级摸到中大尺寸模型的边。Token 消耗虽然高不少,但放在如今超长思维链大行其道的背景下,似乎也还算正常,配合其传统低价策略,综合成本竟然也很有优势。 在而更实际所需的 Agent 能力上,前代 Preview 版在综合可用线上徘徊。正式版则同样有大幅拉升,来到较高可用区间,基本持平或超过曾经的国模标杆 GLM-5.1,十分接近 Opus 4.6 非推理模式。下文会详细介绍。 逻辑成绩: 表格的排序切换为按中位分数降序。 |
|
|
*1 表格为了突出对比关系,仅展示部分可对照模型,不是完整排序。 *2 题目及测试方式,参见:大语言模型-逻辑能力横评 26-05 月榜 (Opus/Qwen/Gemini) *3 完整榜单更新在 大语言模型-逻辑能力横评 26-05 月榜 (Opus/Qwen/Gemini) *4 红字模型代表工作在推理模式下(慢思考),黑色模型则是对应的非推理模式(快思考) 编程 Agent: |
|
|
*1 测试方式参见:大模型编程应用测试-V3榜单 Hy3 正式版基本在各个测试分类都领先于 Hy3 Preview,因此以下主要对比 Hy3 正式版与同为开源且 Size 相近的 DeepSeek V4 Flash(以下称DS4 Flash)。 优势: 编程:在先前 Hy3 Preview 的报告中提到,预览版已经从茫然不知所措的代码小白状态改进到常见技术栈都能写,但会广泛的犯错,乃至小部分场景需要人工辅助。而正式版在大面上减小了犯错的概率。在目前公开榜单的 4 个项目中,比起顶级模型那样全程一遍过,只犯小错误,Hy3 正式版错误概率更高,分布更广,既有因为难以自测产生的 UI 问题,也有功能性 Bug。基本都可以在人工指出问题后,一次性修复,行为达到定义的 B 档。但因为错误广泛,给不到 B+ 档。项目 G 难度偏高,在发文时测试进行到一半,前代 Preview 无法完成第一轮工程初始化,而正式版已经可以相对顺利的往下推进,后续会更新 G 项目分数。本次也加测了多个中等体量的隐藏工程,大部分结果也依然符合 B 档判定。但随着技术栈更加小众,前沿,Hy3 的错误率显著上升,修复能力下降,落回可用线边缘,体现了 Hy3 在这方面仍有改进空间。Hy3 正式版有 2 个显著特征,其一是较为优秀的审美功底,这即包含了传统的 UI 设计审美,也包含图标,渲染,建模等方面,Hy3 都有明显改进,甚至在一些方面达到了国产最佳。其二是 Hy3 有较强的主动发挥倾向。主动发挥的好坏因人而异,对原本预期不明确的用户而言,模型主动发挥可以带来更好的体验。但一体两面的是主动发挥也会带来轻微的不受约束。Hy3 尤其会在需求空白地段按自己想法大量输出,但如果需求约束足够清晰详细,Hy3 也会严格按要求落地。在 Agent 执行过程上,Hy3 在得分相近的情况下,消耗的步数,Tool 数要略少一些,最低的只有其他模型的70%。对应的 Read Token 也同步减少,这在长程任务上会带来显著的完成耗时优势,以及账单优势。但也需注意,在冷门技术栈上,Hy3 的步数就没有优势了,大量试探性 Debug 会吃掉步数和 Token。指令遵循:无论在简单或复杂指令上,Hy3 的遵循能力都明显强于DS4 Flash。尤其在需要一定理解力的指令上,Hy3 遵循能力看齐 DS4 Pro。不过代价是 Hy3 在这类问题上消耗的 Token 也较DS4 Flash 高出50% ~ 150%,但少于DS4 Pro。多步推理:复杂推理问题,Hy3 表现也较好。涉及空间感知、解空间探索类问题,Hy3 甚至可以接近 DS4 Pro 的表现。不过 Hy3 在解决这类问题效率不高,比较依赖暴力手段,缺少灵光一闪式的直觉。即便如此,Hy3 最终也能在规定 Token 限制内解出来一部分。 不足: 文本任务:文本处理类,以及需要精确统计文本信息的场景,Hy3 仍小幅落后于 DS4 Flash。虽然DS4 Flash 也无法稳定拿到高分,但拿高分的概率要略高一些。并且DS4 Flash 对复杂交错排布的文本识别性能更好。这通常是上下文幻觉的一部分,说明 Hy3 的幻觉控制要差一些。 赛博史官曰: 彼时太平洋两岸的人们都曾陷入一段时间的 AI 狂热,企图用 AI 解决一切问题,不惜成本的将 AI 用到所有场景,执着于做一个让所有业务自动化运作的美梦。可等到冰冷的账单击碎梦境,所有人又突然醒悟,开始算起成本来。AI 没有错,自动化也没错,只不过模型的性能成本曲线来没有降低到真正的拐点。Hy3 朝拐点方向往前走了一步,对此而言,意义重大。 大模型竞赛的世界里,风急浪大。对任何一个想要乘船横渡的团队而言,不够扎实的基本功,或者一时的方向迷茫,都有可能在竞赛中落后乃至翻船。这对经历了团队重建的混元而言,更具挑战。如今 Hy3 这艘船重新换好了破损的船壳,刷上了新漆,挂好了帆,迅捷而稳定地行驶在主航道上,海风徐徐,星光灿灿,不知能让水手们今夜安然入眠否。 关于史官本人: 笔者从 23 年 4 月开始从事大模型评估活动,最初的动机只是想弄清楚当时的百度文心一言是否真如媒体所言,落后 ChatGPT 1 年以上。在随后的时光里,笔者收获了对大模型发展的认知,也有幸得到读者垂青。路途中不断结识身处大模型研发一线的工程师们,是他们的点拨和启发,使笔者有动力去尝试做更有深度和更有价值的模型评估。笔者写文的风格也逐渐从向大众读者展示模型优劣,偏向深挖模型优劣背后的问题。 这样的状态或许可以一直持续到大模型再也不需要被人类评估那一天。但在某日深夜,笔者翻阅历史的测试记录,感到模型评估始终是一件充满挑战又意义深远的事,至少在现阶段,仍值得全身心投入,深入行业,进入一线,做出一些微小的贡献。 最终在多角度权衡后,笔者决定加入混元团队,全职从事大模型评估和观测手段探索的研究。 笔者深知以前作为独立第三方评测时所公开信息具有独特价值,为了让这份价值持续下去,今后笔者还会继续独立维护目前公开的推理榜和编程榜,但为了保证公平性,今后的榜单不会再出现混元模型,也不再参与其他模型的内测。而 Hy3 完全是在笔者加入之前完成训练的,请允许笔者将他作为最后一个混元模型保留在榜单上,并持续滚动更新,直到该模型彻底下线。 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
我们仍未知晓后训练的潜力到底有多离谱。 Hy3-preview 是一个拉跨到没法用的模型,但是仅仅两个月不到,Hy3 几乎就达到了 GLM-5.1 的水平,勉强能用来干活了。 这也没啥,最离谱的是这是一个 295B21A 的【小模型】,几乎只有现在顶级模型的零头,就算是 GLM 也有 744B。 去年各家都在堆 Scaling Law,搞到现在,入场券就是 1T,而且各家应该都在憋 10 T 的大招。 人人都觉得一个模型的底子决定了一切,如果底子不太聪明的样子,后面再怎么调也是流口水。 但是从 Composer 2.5 到 GLM-5.2,再加上这次的 Hy3,都是同一个模型脱胎换骨的例子。 受限于压缩智能的信息定律,后训练的知识总量不会增加,但是对这些知识的检索和组织表达能力却发生了质的飞跃。 这就像高考前两个月突击,狂暴刷题,直接改变命运。 当然偏科有点严重,Coding 以外其实还是很呆的样子。 |
|
|
现在的鹅厂 众所周知,DeepSeek 的后训练几乎没有。 要是下周 DeepSeek V4 的正式版也能有这种狂暴提升就爽了。 说到后训练,这方面最离谱的还是 SDXL,呃,3.5B 的小小模型。 自从用上了 DPO 偏好对齐,这位老将的新权重的 ELO 分居然还在不断地向上拱。 只要提示词对上了频道,就可以把那些参数量比它大得多、架构也先进得多的新模型按在地上摩擦。 懂不懂人类育种的含金量啊。 在过去的几年里,社区被动清洗了数以亿计的图像,元数据全存图像标签里了,等价于手工打标签对齐。 再加上 ControlNet 矩阵和 IP-Adapter 二次对齐,实际可控性和对齐效果差不多接近于 100%。 还有无数的社区点赞/点踩数据,老二严选,相信老二的判断。 外加人类一代代杂交权重,精选模型,优秀的模型能有更多的交配机会; 这玩意儿就是赛博杂交水稻啊?! 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
原来我一直在用的元宝不知道什么时候默认把模型换成混元了。 |
|
|
用我此前设计的经典复杂情境推理题来测试: 阅读这篇小文章,回答后面的问题: 我有一辆永久牌自行车,牛奶和巧克力色的喷漆,“公主车”样式,刚买回来的时候还挺爱骑,渐渐地也就丢在楼下积灰了。 后来很少骑它的另一个原因是,打气不方便。附近路口遇不遇的上修车的摊子,全凭运气,记得有一次大热天,为了打个气,推着车轱辘走了几条街,才终于遇上一个踩着三轮车赶路的师傅,我求他借气筒给我打气,他还不太乐意。 于是我跑去买了一个打气筒。问题又来了:每次打完气,如果再返回家(我住最高层)收好打气筒,再下楼把车骑走,简直太麻烦。 苦恼的我想了个办法:打完气就把打气筒藏在楼下附近的草丛里,心想应该不会被人发现,以后要骑车直接在草丛里找打气筒,不用再上楼下楼。 事实证明我太乐观,很快,打气筒不见了。于是那辆车又开始放在那日晒、雨淋、积灰。 几个月前,红橙黄绿青蓝紫的共享单车们开始遍地开花,我看到人们骑着车子的潇洒姿态,回忆起了我的牛奶巧克力公主车。我在楼下一堆破车里,把它认了出来,尽管有点灰头土脸,它独特的气质还是让我心生骄傲。骑在街上,一堆共享单车里,它的颜色是最低调的,却有一种浪漫的怀旧感。 然而,打气依然是个问题。正当我重新被此事折磨的时候,事情有了转机。 我在李雷家里看到了一个两用打气筒,既可以给篮球打气,也可以给车胎打气。我想到了一个万全之策。我跟李雷说:我来你这的时候,能不能把自行车骑来,我回家的时候,你拿着打气筒下楼帮我打气呢? 李雷很爽快地答应了。于是我早上踩着瘪瘪的车胎出发了。 后来我知道,李雷答应得这么爽快的一个原因是:他想学骑车。 李雷说自己小时候生活的地方,出门都是陡坡和山路,所以一直也不会骑单车。而现在想学骑车,也是因为受了大街上共享单车的刺激。 于是,他开始用我的公主车学,一开始勉强能骑,但不会拐弯。 他骑不好的时候就问:“发明自行车的人,怎么就确定这个东西能骑呢,在他发明之前,是无法确认人们有骑它的本事的,如果没法确认人们有这个本事,他又哪来的自信来发明它呢?” 我认为这是个强词夺理的问题。 后来,他又嫌我的车“车头太灵活”。 但不管怎样,李雷最后还是学会了骑车,但这给他带来了新麻烦。 学会骑车后,李雷像很多人一样,经常上下班蹬两个轮子去地铁站。蹬了大概一个月。上上次我见到他,他说:“我屁股疼。” 我安慰:“习惯了就好了。” 上次我见到他,他说:“我这些天只能吃牛屎了。” 我大惊失色,“为啥?” “我屁股上长了个痔疮。” “哦。”我恍然大悟,“没错,你痔疮好之前,只能吃niushi了。” 可一回头他就点了个锅贴的外卖。 “吃锅贴拉屎可疼了。”我说。 “吃进去再拉出来的不疼。” 1.为什么作者对李雷说“吃锅贴拉屎可疼了”,而李雷回答说“吃进去再拉出来的不疼”? 2.李雷为什么说“我这些天只能吃牛屎了”?是因为他喜欢吃屎吗? 3.根据文中给出的多个线索,请猜出李雷是中国哪个省份的人? 4.你认为李雷是一个什么样的人? 5.你认为本文作者跟李雷是什么关系? hy3回答: 1. 为什么作者对李雷说“吃锅贴拉屎可疼了”,而李雷回答说“吃进去再拉出来的不疼”? 这是两人围绕“痔疮”展开的幽默调侃。作者知道李雷长了痔疮,认为吃锅贴这类食物后排便会刺激患处,所以说“拉屎可疼”;李雷则是用歪理耍赖——他把“吃进去的东西最终变成排泄物”这个生理过程当成挡箭牌,故意曲解成“只要吃进去再排出来就不疼”,本质是用无厘头的逻辑消解痔疮带来的尴尬,属于朋友间的搞笑互怼。 2. 李雷为什么说“我这些天只能吃牛屎了”?是因为他喜欢吃屎吗? 当然不是。这是李雷的夸张玩笑:他因为长痔疮,饮食需要清淡、避免刺激,但他用“吃牛屎”这种荒诞说法自嘲,既吐槽了痔疮带来的饮食限制,也制造了喜剧效果,和“喜欢吃屎”没有任何关系。 3. 根据文中给出的多个线索,请猜出李雷是中国哪个省份的人? 文中线索指向贵州省(或云贵川山地聚居区,最可能是贵州): 李雷说“小时候生活的地方,出门都是陡坡和山路”——云贵高原多山地丘陵,贵州更有“地无三尺平”的特点,符合“出门陡坡山路”的描述; “牛屎”是西南地区农村常见表述,且西南官话区日常口语中常用这类接地气的乡土词汇自嘲,和文中语境高度契合。 4. 你认为李雷是一个什么样的人? 李雷是个性格爽朗、幽默接地气、有点“杠精”式好奇心,又带点生活钝感力的人: 爽快:二话不说就答应帮作者打气、借车学骑车的请求; 幽默:用“吃牛屎”“吃进去再拉出来的不疼”这类无厘头发言化解尴尬; 爱琢磨:学骑车时会问“发明自行车的人怎么确定人能骑”这种看似抬杠、实则带点哲学感的问题; 随性:明明痔疮犯了,还是忍不住点锅贴外卖,不算特别自律但活得松弛。 5. 你认为本文作者跟李雷是什么关系? 两人是关系亲近的朋友(很可能是同城好友/邻居): 作者会主动提出把车骑到李雷家、让对方帮忙打气,说明彼此信任、相处随意; 李雷会拿自己的囧事(学骑车、长痔疮)和作者开玩笑,作者也会直白调侃他的饮食,互动毫无隔阂,是典型的熟络好友状态,甚至可能是住在附近、经常串门的邻居。 评价(满分10分,每道题2分): 第一题可得满分;(+2) 第二题零分; 第三题算答对一半;(+1) 第四题和第五题都OK但也没有太出彩的地方,各1.5分;(+3) 总分:6 比起一年前有进步,一年前的混元模型第一题都在强行解释,还解释错: |
|
|
一年前的测试留档截图 来自GPT的标准参考答案: |
|
|
|
|
我觉得腾讯的股票可以涨一涨了。 姚顺雨团队这一轮确实摸到了做模的手感,我怎么说来着,给姚一点时间。 把 Preview 那个被大家调侃的"残疾模型"一路拉到主流水准,进步幅度是能肉眼看出来的。我的判断是,Hy3 正式版出来之后,腾讯才算从 AI 的"围观群众"变成"正式玩家" ,这算是腾讯的 Gemini 2.5 Pro 时刻。 (别下个季度嗦回去) 混元3 到底什么水平 跟最近发的豆包 Seed 2.1 Turbo 对标着说说: 错误率:Hy3 略高于 Seed 2.1 Turbo,豆包能一次过的题,Hy3 偶尔要 debug 1-2 次才能跑通 但下限稳:没有出现死活过不去的"智障时刻",这点比 Preview 强太多 自省能力:Review 阶段偶尔能自己抓出用户没提醒的 Bug 自己修,这个细节挺加分 思考长度:比豆包短,效率高,日常对话的自然感也更丝滑——豆包有时候想太久,反而把节奏拖垮 套到 Workbuddy 这种轻量级 Agent 场景里,Hy3 正式版已经相当能打了。 元宝上那版模型也脱胎换骨,Preview 时代那种无头苍蝇、语无伦次的感觉基本没了。 槽点:Workbuddy 本身太慢了,慢到想砸键盘。腾讯入场之后,盘子的形状变了 之前国内大模型牌桌,字节(豆包)+ 阿里(Qwen)是两座山,腾讯一直有点"人在但没坐实"的意思。Hy3 这一发,三巨头格局才真正锁定——字节、阿里、腾讯,三家现金流都厚,不会轻易倒,技术迭代速度也咬得住。 如果 Token 大盘没有明显扩容,接下来就是存量博弈,三家往下卷营销、卷生态、卷应用场景,创业公司夹在中间是被持续施压的背景板。不是不能活,是要活得比以前更精。 尤其是大厂营销一放量,那真的是会卷死人的。 腾讯这次是"登堂"了,"入室"还要看底模再扩三五倍之后,泛化和覆盖能不能再上一个台阶。但至少,Workbuddy 不用再背"空壳子"这个骂名了。 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
比预览版进步了一丢丢,但毕竟是小参数模型,所以只能跟flash一桌。 能力跟M3差一点点(毕竟M3有多模态跟大上下文),参数比M3小一点,价格比M3高(M3的套餐就算在提价后依然是全模型官方最低,除了ocg的flash这种非官方渠道以外)。所以在M3全中国大陆黑的情况下,是怎么给hy3高赞誉的?如果你们真觉得hy3不错,那么当初全知乎一齐黑minimax M3的理由又在哪? 当然,我不是说hy3不能用,实际上绝大多数任务用小参模型就够了,哪怕是hy3预览版,我拿它做生产环境的C++代码也是能应对的。越是经验丰富的软件工程师越知道自己需要什么,越是能精准的告诉大模型该做什么,这种情况下确实 flash 级别的模型就够了。 但如果非要讲 flash 级别的模型比肩 glm ,我想说你们别太夸张哈。 如果你是许愿编程的门外汉,那么你确实需要最靠谱的模型来给你兜底。如果你是经验丰富的软件工程师,哪怕 hy3 preview 那个级别的模型在你手上也是能用出花儿的。 当然,这确实是个不错的起点,我在preview阶段就已经指出 hy3的能力是能上桌的,只不过上的是flash那一桌。市场上有更多的服务提供者对消费者来说终归是好处,毕竟腾讯不是行业冥灯,这样的企业多来几个确实不坏。 |
|
|
| [收藏本文] 【下载本文】 |
| 上一篇文章 下一篇文章 查看所有文章 |
|
|
|
|
娱乐生活:
电影票房
娱乐圈
娱乐
弱智
火研
中华城市
印度
仙家
六爻
佛门
风水
古钱币交流专用
钓鱼
双色球
航空母舰
网球
乒乓球
中国女排
足球
nba
中超
跑步
象棋
体操
戒色
上海男科
80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联 |
| 网站联系: qq:121756557 email:121756557@qq.com 知识库 |