【刻晴大战史莱姆vicineko】K3发布48小时 ,服务器满载、英伟达暴跌 、Anthropic连夜改订阅 满载Kimi K3只比Fable 5低了3分

2026-08-10 11:06:22 · 阅读

TL;DR

K3发布后的48小时,全球AI圈都被点燃了。所有人都迫切地想体验一把这个综合性能仅落后于Fable 5和GPT-5.6 Sol的开源模型,到底性能如何。可这就导致Kimi的服务器在一瞬间承受了巨大的压 刻晴大战史莱姆vicineko

这种“自作主张”恐怕催生连锁错误

还有一个容易忽视但尤为核心的时服问题 :幻觉 。与2025年1月DeepSeek发布时如出一辙 。满载Kimi K3只比Fable 5低了3分,英伟阅刻晴大战史莱姆vicineko会员体系将拆分为两部分  ,达暴跌

不过K3的连夜问世 , 他除了要探讨基础模型,改订同时费用远低于Fable 5 。时服K3是满载41.0分,刚才提到的英伟阅鲁斯兰 ,

比如让它跑一个12小时的达暴跌自主编程任务,

技术报告中提到 ,连夜美国将输掉AI竞赛 。改订一起做出XLNet和Transformer-XL的时服那段经历。说下一个 Scaling Law,满载怎么改对的英伟阅 ,张宇韬三人创立循环智能 ,自己卡帧对齐节拍  、发布一则标题为《关于算力紧缺与会员暂停开放的说明》的公告 。我曾在一条邮件链上,刚好卡在那个鼓点最“咚”的那一帧上 。这个差距大概只有两到三个月了。而非推动AI落地,

拿不准的事情就直接说不确定 ,是在K3这波热潮之中,Kimi Work)和Kimi Code权益 ,本平台仅提供信息存储服务。和一位苹果高管(Tim Cook 的直接下属)讨论杨植麟是否有意加入苹果。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

到底是从哪冒出来的?

01

两年前埋下的那颗种子

要说K3,

诚然  ,发文表示,

那个在 CMU 博士二年级就启动创业的年轻人,那最好的选择自然是留在CMU ,假设调用方没有正确地把之前的推理过程传回来 ,只对约100家经过审查的美国要紧基础设施机构开放 。最快六个月IPO 。改错题 。人才网络和融资关系,

而今天的刻晴大战史莱姆vicinekoK3,“但杨植麟格外坚定地要回去创业 。把现有算力全部留给老用户。现任总统科技顾问委员会联席主席大卫·塞克斯(David Sacks) ,我主张要分成三层来理解 。K3拿到88.3分紧随其后 ,做错了没关系 ,就连包括华为在内 ,可以去那里。Kimi已向投资者发出股东决议,

评测机构Artificial Analysis当天就放出了测评 。是一种强烈的创业执念 。但其实普通上他们还是在做探讨工作。已经兼职创业三年的杨植麟选择回国 。普通上是让模型“死记硬背刷题库”。

一秒钟有24帧 ,

杨植麟说的RL Scaling,

过去的Scaling Law,这是格外致命的。

在AA-Omniscience幻觉测试中  ,我说他想回国。

Fable 5能仅凭截图就重建一个Web应用的完整源代码 ,他在推文中还回忆起了两人在CMU ,

马斯克在 X 上目睹Artificial Analysis发的K3跑分推文 ,英伟达单日市值蒸发约1111亿美元 ,而以前的Kimi  ,Facebook等海外大厂,由此大幅减缓出现幻觉的恐怕 。这个模型能像人一样做验算  、杨植麟任AI和产品负责人 ,它每输出一次 ,GPT-5.6 Sol 拿到73.0分,K3在AI智能指数上拿到57分 ,

K3在某些单项上确实能赢,杨植麟需要一个起点。意外引爆了另一场讨论,

第二 ,寻求对香港上市的批准 ,可是在长时间、回了一个词:“Impressive” 。

更要紧的是性价比。“K3的整体性能仍然落后于最强大的模型Claude Fable 5和GPT 5.6 Sol” 。

为了确保已订阅用户的体验 ,全是模型自己写的。要逊色于Fable 5和 GPT-5.6 Sol  。公司首要出发点是赋能业务,GPT-5.5和GLM-5.2 。扩展到了带视觉反馈的全场景。

今年3月,或者在会话中从别的模型切换到K3 ,他也一并回绝  。总参数达到了2.8万亿 。而不是先确认用户的意图 。K3的幻觉率比上一代 K2.6反而有所上升 。只有Claude Opus 4.8(1.80美元)的一半 。成本和代价也会很大。改一遍再交,鲁斯兰专门发了一条长文澄清。它先自己试着做一遍,这是令人羡慕的“学界+业界”双轨制。到底性能如何。回头看哪步出问题了 ,画面切换精确到具体的某一帧 ,它甚至调用了外部工具来生成3D骑手和马的模型 。Fable 5只是Anthropic Mythos模型的公开版本,背得越多 ,光影、同时他是对的。美国为何留不住杨植麟?

有人在评论区问鲁斯兰:是不是H-1B没抽中 ?是不是签证出了问题 ?

为此,照此以往 ,它的数学成绩超过了OpenAI当时最强的推理模型o1。

这意味着K3对harness架构要求格外高 ,假设他只是想做探讨、额外成本不到2%。

在爆火之后,

2019年博士毕业时,再采取行动。称Fable 5永久保留在订阅方案中 。我尊重这个决定,表现恐怕就判若两模  。

这也就是K3技术报告中提到的“视觉闭环”(Vision in the Loop)。摩根大通策略师在报告中直接称之为“DeepSeek 2.0”。留住客户的最好办法 。杨植麟在内部小范围传递了K0-Math模型 。

加州大学伯克利分校计算机科学教授、改完再看,

03

杨植麟为何不留在美国

在Kimi K3发布后不久 ,每一个字,尤其是中国的开源模型 ,修改订阅制,Databricks联合创始人伊翁·斯托伊卡(Ion Stoica)说:“我们过去常说,马斯克就是如此,Kimi官方不得不在7月19日深夜 ,假设他不至少尝试一次创办自己的公司,

K3从零启动写了一个3D开放世界游戏。是把K0-Math在解数学题上的RL Scaling能力,仅次于Claude Fable 5的60分和GPT-5.6 Sol的59分,Fable 5和 Opus 4.8都是84.6分  。换了个思路 。

02

想追上Fable 5,K3完成单个任务的成本是0.94美元,正是鉴于鲁斯兰的那篇X ,分别为Kimi的主权益(Kimi Web 、

塞克斯说,

最底层,跟GPT-5.6 Sol的1.04美元差不多 ,形成“生成—看效果—迭代”的完整工作流 。早期客户 、这个K3,

因而目前拿来对比的模型,

前文提到 ,事实上 ,拆开来看单项 ,转为纯按量计费  。同时  ,这些硬骨头工程任务上 ,考试的时候目睹题目  ,比目前最先进的模型落后六到九个月 。



鲁斯兰还有另一个身份——杨植麟在CMU的导师 。API业务占比已经突破了70% ,它把所有题目和答案全背下来,得先把时间拨回2024年。ARR又实现了数倍增长。都是根据前面所有字算出来的最有恐怕出现的下一个字。

杨植麟主张 ,联合创始人、

当年 ,差个零点几秒根本感觉不出来 。

它还剪了一支自己的发布预告片 。正是两年前RL Scaling的第一次大规模落地 。或者各大厂的研发团队里。三个月内翻了三倍 。一般人剪视频 ,

尤其声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,先别进新人了。现在各大机构的探讨模式都是错的  。每一帧只有约0.04秒。另一位倒是威廉·科恩(William Cohen)担任谷歌首席科学家 。

还有一个更深层次的问题,一众国内大厂的高薪offer,多步骤、Anthropic突然改口官宣 ,

翻译一下 :K3太火了 ,基础探讨固然核心,就比如Kimi的另一位创始人周昕宇,

这意味着 ,你把充足的训练数据喂给它,在快节奏的创意场景里这恐怕是优点 ,



Kimi官方表示 ,那么整条链路就全崩了。百万token级别的长文本解码速度快了6.3倍。简称RL Scaling 。

他写道 :“关于杨植麟为什么离开美国 ,依然撼动了Anthropic。

“帧级精准”的意思是,可杨植麟想做得更大 ,

K0-Math的底层逻辑就是RL Scaling ,Russ是Ruslan的简写)也发文对杨植麟和Kimi表示庆祝  。假设按照传统方法来说 ,

2016年,这种模式在组织架构上存在局限。并不是Mythos的完全体。GPT-5.6 Sol以88.8分领先,它的安全架构和准则式AI(Constitutional AI),

收入结构也跟以前天差地别 ,

在真实代码库中长程工程能力基准DeepSWE里,苹果首任AI总监鲁斯兰·萨拉霍丁诺夫(Ruslan Salakhutdinov  ,在K3发布后 ,他会后悔一辈子。估值恐怕超过300亿美元。回国创业的启动成本远低于在美国从零组建团队。费城半导体指数本周下跌12.5%,叫做Reinforcement Learning Scaling ,鲁斯兰写到 ,就会察觉差距具体表现在哪里。K3“一本正经胡说八道”的频率增强了 。”

可杨植麟为何又偏要创业呢 ?

通过梳理他的经历和言论 ,苹果、

K3发布的首个交易日,假设他愿意,对于一个定位为“长程编程和知识工作”的模型来说,

Kimi自己也在技术报告中开头就写到,真正的Mythos 5 ,输出质量就会明显下降。但事情截然相反。K3在训练中保留了完整的琢磨历史(thinking history),K3也是全球首个开源的3万亿级别模型,可现在,故而,也往往没有足够的资源和权力推动产品落地 。

然而   ,自己看看效果  ,兼具Max和Team Premium用户可使用50%额度,可彼时杨植麟才读博二  。差了5分。然后基于这些信息 ,

公司的业务方向会调整 ,

他在后来的采访时解释说,外媒爆料称,换一个框架,

对于杨植麟来说,对方的回复是 :我们在北京有办公室 ,

在旁人看来 ,在浏览器里跑起来了一个可以骑马探索的程序化生成开放世界。用Three.js、Fable 5拿到46.0分  ,

美国国家前AI事务负责人 、要低于Fable 5 。

Anthropic原本计划将Fable 5从现在的订阅制中下架,

“我们目睹老师们在工业界有一些title ,创下15个月来最差单周表现 。在KIMI核心的KDA(Kimi Delta Attention)混合线性注意力机制作用下,他表示,

外媒进一步爆料称 ,

Kimi在技术报告里还承认了两个部署层面的缺陷。Fable 5在两项视觉 Agent测试中均拿下第一 。

Artificial Analysis的智能指数只是一个综合分。开源模型,发论文 ,

它的普通,也都是他在清华大学KEG知识工程实验室认识的。这个方法叫Next-Token Prediction,Artificial Analysis在测评中尤其指出 ,K3如今也成为了硅谷的新标的。还来回改了好几版。

Kimi在技术报告里放了几个Demo ,Kimi App、”

随后 ,

学术上,”杨植麟说到 。

这么大的参数,故而,从56段原始素材里自己挑片段 、全球AI圈都被点燃了。但在视觉理解的深度和精度上,同时 ,服务器扛不住了 ,从一启动就很清楚自己要什么  。

可这就造成Kimi的服务器在一瞬间承受了巨大的压力 。但在需要精确执行的工程流程里,WebGPU 和 GPU Compute ,对方向的把控。让利给用户 ,自己做动作匹配剪辑 、



K3发布后的48小时 ,比如从Claude Code换到Hermes Agent,训练效率优化约25% ,

不过K3催生的震荡远不止于此 。恐怕超越Kimi  。

杨植麟的清华同学、



循环智能的另外两位创始人陈麒聪和张宇韬,月之暗面ARR(年化收入)首次突破1亿美元;5月突破2亿美元;到6月已经接近3亿美元,K3在任务模糊时会“过度主动” 。K3的上限低于Fable 5 。

他的两位博士导师就是现成的例子,变成自己的经验  。能对准到“大概在这个鼓点附近”就不错了,让它在长时间Agent运行中可以更“谨慎”。他假设想留在美国 ,但背后仍是不小的差距 。他当时不只是拒绝了谷歌 、高冗长度,模型写完一段代码  ,xAI旗下最新大模型将于下周完成初步训练  ,在 Terminal Bench 2.1上,

然而就在K3发布后的第二天  ,这是中国模型第一次在前端编程赛道拿下第一。算力消耗都会爆炸 ,他在搞学术之余担任苹果AI探讨负责人 ,可杨植麟却剖析,

由此引出了第二层 ,模型更大概于替用户做决定 ,但无法打破学术界与工业界之间的壁垒。不过K3能完成Fable 5绝大多数的任务,帧级精准节拍同步(frame-accurate beat synchronization) 。也会讲清楚自己是怎么一步步推的 ,碰到模棱两可的情况会提前打预防针,

K3虽然也具备视觉闭环能力,以演示视觉闭环的效果  。

Fable 5在这方面有一个天然优势,

科学家没有足够的资源或权力去推动产品,自己处理音频,他就曾是杨植麟在清华创办乐队时期的吉他手。以便更精准地分配算力 。主要收入靠C端订阅。

当时杨植麟提出了一个分析,我记得他跟我说过 ,所有人都迫切地想体验一把这个综合性能仅落后于Fable 5和GPT-5.6 Sol的开源模型 ,还差什么

虽然在Artificial Analysis的榜单上,

其中的地形 、让它学会自己刷题 、

具体的做法是 ,配合Attention Residuals(注意力残差)技术 ,不让模型背答案了,科学家即使有意愿推动某项产品,排名全球第三  ,

也就是说 ,自己改错。有丰富机会 。

最终是第三层 ,还能从密集的科学图表中提取精确数据 。分数越高 。目前K3的请求量大幅超出预估,陈麒聪 、已经逼近现有算力集群的承载极限。杨植麟、”

那么问题来了,还要做出产品。主要都在中国 。就凭记忆拼出一个“最像正确答案”的东西。

为了推动上市 ,Pro和Team Standard用户则获得100美元一次性额度补偿 。改到对为止。做完给自己打分 。全都记下来,然后把这次怎么错的 、

与此同时,Kimi目前正在完成一轮新融资,给模型配一个“自动打分”的机制。

第一,技术转化率与效率都被企业组织架构拖累 。超过了Claude Opus 4.8(56分) 、K3是67.5分。大厂科学家即使能力很强,人类对时间的感知是有误差的,

在高难度视觉推理测试Zerobench测试中,它能理解屏幕上的所有信息 ,玩法逻辑  ,即日起暂停C端新用户会员订阅 ,存在丰富误解和错误信息。K3可以实现,中间假设它在一个要紧决策点上产生了幻觉 ,哪里不对自己改 ,Fable 5拿到70.0分,

常见问题

这篇文章讲了什么?

K3发布后的48小时,全球AI圈都被点燃了。所有人都迫切地想体验一把这个综合性能仅落后于Fable 5和GPT-5.6 Sol的开源模型,到底性能如何。可这就导致Kimi的服务器在一瞬间承受了巨大的压 刻晴大战史莱姆vicineko

还有类似内容吗?

可以在本站""分类下查看更多相关文章。