Kimi K3 深度测评:实力暴涨却配额告急,与 GPT-5.6、Fable 5 全面对比
K3 已测,确实强,但要命的是配额太少了!

一天不到,一周的配额已经烧完,大约只生成了 5 个测试页面!
从这五个例子可以看出,有些表现非常抢眼,有些则差强人意,个别甚至比较糟糕。
我不会像那些收钱办事的博主一样只做片面宣传,也不会专门挑 Kimi 的缺点来说。接下来我会把测试结果依次展示,同时和其他国产模型,以及国外的 GPT 5.6、Fable 5 做一个对比,尤其会重点对比 Fable 5!
下面我就逐项展开,看完这篇文章你应当能对 K3 建立起一个比较全面的认知。
先来说说引发我兴趣的这张图片:

我第一眼看到这张图,还以为是 AI 生成的。这个数据实在是太夸张了!
Kimi-K3 已经把强到可怕的 Fable 5 按在地上摩擦了!
如果这个排行属实,我还买什么 Fable5,直接续一波 K3 就好。
这成功勾起了我的好奇心和“打假”的冲动!说实话,我完全不信这个排名!
所以,必须自己实测一下,心里才有底。
1、只有 99+ 才能玩!
当我真正产生兴趣,准备开测的时候,发现一个很尴尬的事情:

我的初级套餐,根本不配使用 K3 模型,只有 99 元以上的套餐才可以用。当时我就犹豫了,因为 Kimi 家的配额全网最少,我原本已经打算弃坑了,但是它的数据又很亮眼,讨论也特别热烈,很多人催着我测,搞得我也很想探一探它的深浅。
大家确实很关心一个问题:K3 到底值不值得买?
这次直接从 2.7 跃升到 3.0,也算是大版本升级了!那就买呗,99 元又不是花不起!

买完之后才发现 1M 上下文需要 199 元才能用,我 C#@¥@#%¥@%!

Moderate 这一档上下文居然只有 256,要到 Allegretto 才有 1M 上下文,°(°¯᷄◠¯᷅°)°!我感觉 K3 已经有点“高攀不起”了!
2、基准数据和特点
根据开发者后台的提示:这次 K3 的核心卖点是 1M 上下文,擅长编程、游戏 3D 和知识任务!
这不是巧了么!
我最近刚好让 Fable 5 做了很多前端的 3D 和游戏项目,专业对口啊!
按照国际惯例,我们先来看一下官方发布的技术博客。
官方博客里是这样概括这个模型的:
具备原生视觉功能和 100 万个 token 的上下文窗口。它是全球首个开放式 3T 级模型,专为跨长期编码、知识工作和推理的前沿智能而设计。
它对自身的评价是这样的:
虽然其整体性能仍然落后于最强大的专有模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评估套件中表现出了前沿水平的性能,始终优于其他受测模型。
这个说法看起来还是很低调客观的,其实带着一点小傲娇。内涵是:我们只是比最强的 Fable 5 和 GPT 5.6 Sol 差一点点,其他嘛,我不说,你们去品!哈哈!
接下来看两张基准数据。
一张是编程(Coding)能力:

一张是通用智能体(Agents)能力:

这里有很多基准,我就不一一解释了。大家可能一时看不懂这些概念,但排名总归是看得懂的。
整体上,有一种除了 Fable 5 和 GPT-5.6 之外,我就可以横着走的感觉,Opus 4.8 完全只能坐在另一桌了。
另外还有一个很关键的点就是模型参数量:

K3 这 2.8T 确实很有分量!
这个参数量确实来到了一个很恐怖的位置,比之前所有的开源模型都要大很多,比 1.6T 的 DeepSeek Pro 整整多出 1.2T!
众所周知,模型参数一大,脑子就会清楚很多,同时也会贵很多。
插一句题外话:
其实几个星期前,Kimi 的人就接触过,当时就感觉会有比较重要的发布。因为我已经非常确信,我不会接商单的,我要直接去开发游戏和软件,并分享实战经验。所以就没有深入聊下去!
另外再补充一点小知识:模型发布第一天,就能发文章的人,大多都参与了内测,而内测的人 99% 会倾向于说好话,而且其中很可能包含商单或其他合作。
所以,头几天的评测信息得谨慎看待!
我对 Kimi 的印象整体还可以,今天就来实测一下这个模型。看看它的基准数据是否靠谱,以及那个大模型竞技场排名第一是否真实。
其实稍微懂点逻辑的,就会发现一个小问题:Kimi 自己承认不如 Fable 5,而竞技场排名却比 Fable 5 强。这里出现了“不等式”,哪里有问题?
3、测试工具
接下来介绍一下测试工具。我之前一般比较喜欢用 Claude Code,但碰到 Kimi 我通常会选择他们自家的 KimiCode,这次也不例外。
用官方的 KimiCode + K3 Thinking 应该能发挥出最强的能力。

具体用法是:直接打开终端,输入 kimi 启动,会自动升级到最新版!
然后选 K3,再把 Thinking 打开。目前只有开和关,还没有更细的等级划分。
然后,我们就可以正式开搞了。
我大概会展示 4 个例子,这几个例子,有经典游戏复刻,有概念融合,也有一些原创的老题目和新题目。
因为 Kimi 最强的就是前端,所以这次重点测前端合情合理,最后一个题目会涉及联网游戏,可能稍复杂一些。
1、甲维斯的车库
因为 K3 的特点是模型比较大,开发、3D 前端、世界知识都比较强。所以就先来做一个“甲维斯的车库”吧!这是一个新题目,之前测试 GPT 5.6 Sol 和 Fable 的时候引入过。
题目如下:
我在网上看到一个很有意思的例子,就是有人做了一个在线车库,可以快速切换车库中的各种车辆,以及显示这个载具的数据,中间展示具体内容,可以通过鼠标拖动查看不同角度,可以切换涂漆,可以切换视角,可以自动旋转展示!网页配色、布局、内容我希望你尽可能还原参考图 2.png,不同之处在于车库里的车子,以及骑车的人,还有车库的名字。
车子我希望你做一辆自行车,一辆电瓶车,一辆机车,一辆三蹦子,一辆五菱宏光,一辆特斯拉,一辆小米,一辆保时捷,一套钢铁侠的经典战甲。具体型号你自己定,要主流的型号。
骑车开车的人物根据参考图 1.jpg 的头部形象进行设计,做一个 3D Q 版卡通形象。车库的主人是 Jarvis。
我的需求就是这样,细节你来完成,我只负责验收。使用单个 HTML 和前端技术完成,只输出最终结果页面。
这个题目其实并不简单,市面上很多模型都做不到及格。
因为这个题目是多维度的考验,首先必须具备多模态能力,因为我会提供两张参考图。

这个题目的核心要求如下:

关键的考察点包括:

这种题目其实不存在侥幸,如果某一个环节的能力不行,最终结果就完全没法看。只有每个维度的能力都还可以,最终才能呈现出一个还说得过去的结果。但是截至目前,还没有哪个模型能真正做到特别优秀。
题目说清楚了,我们就可以开始测试了:

测试之前先看一眼我的配额情况:

全部都是全新的,周配额、小时配额都是满的。
经过极其漫长的等待(大约 5+ 个小时),终于出结果了:

下面是它做的“三蹦子”:

它做的 Model 3:

整体来说做得非常好! (甲维斯发型设计略显拉跨)
首先网页复刻,从布局来看很到位,说明它的多模态能力确实国内最强!
而且网页上的功能点都能正常工作,调速的那个滑动条完全正常,这已经超过了相当多的选手!
另外,3D 建模能力也确实很亮眼。首先车子是车子,人是人,没有出现扭曲和分离。
其次,特斯拉的全景天幕和半透明效果都做出来了。
它对不同车型的整体理解也是对的。
整个任务的规划也相当不错:

它是先写完全部代码,然后做语法检查,再截图进行图片识别,接着根据图片修复问题,最后整体复查一遍。
这个思路非常清晰,而且中间没有犹豫和反复。
2.7 时代感觉是在用烧 Token 来弥补智商不足的问题,这次明显是运筹帷幄,参数大了就是聪明了很多。
没有对比大家可能对这种提升还不太清楚,我贴一下 K2.7 和其他模型的效果图,你们就很清楚了。
下面是自家老版本 K2.7 的特斯拉:

这应该是出了车祸之后的样子吧!
腾讯混元3的特斯拉:

第一次 JS 错误,修改一次之后才得到上面的结果。这个外形肯定不是特斯拉。
国产最强“盲人”模型 GLM 5.2 的特斯拉:

配色全崩,功能点也很多不到位,建模更是抽象。
Grok 4.5 的特斯拉:

Grok 4.5 太不应该了,你忘了你的出身了吗?忘了你们老板的看家本领了吗?
GPT 5.6 Sol 的特斯拉:

这是它的第二版,第一版没有理解 3D,做了个纸片人,这是明确提示词之后的效果。GPT 5.6 的前端还是不行,其他模型也有很多错位的地方,空间感稍差。
Fable 5 的特斯拉:

布局和色彩还原非常到位,所有功能点都正常,整体建模也不错,但是默认没有做半透明的侧窗玻璃,头发有一点穿模。
单从这次测试来比较的话,K3 确实有点东西了。
本来测下来 Fable 5 的建模能力和空间感是最好的。看完 K3 之后,好像确实有种比 Fable 5 还好的感觉啊~~!
但是我必须指出一个非常严重的问题,Kimi K3 的配额消耗太猛了!为了测试上面的例子,我大概消耗了两个五小时周期,我这已经是 99 元的套餐了。49 元的套餐基本就是秒没。
2、超级玛丽
刚才那个例子测试了多模态、世界知识、3D 等能力。下面测试一下老游戏还原能力,让它给我复刻一个超级玛丽的游戏。
下面是它的最终效果:

这是 Fable 5 的最终效果:

实话实说,K3 的完成度已经非常高了,几乎没有硬伤,地图像模像样,经典元素齐全,操作手感也很到位,而且它第一次就把蘑菇的回弹和鸭子做出来了。Fable 5 在主角还原上要比 K3 好一些。
在这个例子里,我感觉两者不分伯仲,都表现得相当出类拔萃。
3、赛博朋克版清明上河图
第一个题目是复刻网页和3D效果,第二个是复刻老游戏。这些内容其实都属于“照着抄”的范畴,做得好,可能只是“抄”的能力比较强!下面来一个我自创的题目——《赛博朋克版清明上河图》。
这个题目的重点在于风格与内容的融合。
K3 的结果如下:

这是 Fable 5 的结果:

从这个例子来看,K3 整体表现比较平淡,而 Fable 5 的内涵更为丰富,它不只是一条简单的街道。有古装的人物,有桥,还有船和倒影,有拉车的驴,还有两种刻画精致的飞行器。它真切地描绘出了一个古典与赛博结合、意蕴丰富的画面。
其实这种宏观视野和元素融合是非常困难的,仅靠死记硬背根本做不出来。
4、3D台球
上面的题目,我都提供了比较多的提示词,而且很多题目可能已经被针对性优化训练过!于是我想了一个开放题。我直接说想做 “3D 台球”游戏。
然后问它有什么想法,再根据它推荐的线路来实现。
这个题目,我没有做任何预设和限制,也没有提示它用什么技术框架,没告诉它有哪些坑要避开。我只说了,要 3D,要好玩,视觉效果要好,走拟真路线,最好可以联网玩。
K3 大概消耗了一个五小时周期,结果如下:

这个是主界面,它设计了三种模式,分别是单人练习、本地双人、在线对战。
然后我点开单人练习看了一眼:

这个例子,崩得就有些厉害了!
有两个非常严重的问题。一是建模上的问题,这个台球桌没有 6 个落球的袋口,这实在是离谱。另一个是杆子非常晃,操作手感极其糟糕,很容易让人头晕。
我也用同样的方式测了 Fable 5:

这个主界面明显比 Kimi 的设计感好很多,而且功能也丰富不少。它还做了玩法说明。最有意思的是它把这个游戏命名为“神杆”!而 K3 只是干巴巴地叫它“经典台球”!
再看一下主界面:

可以调整抬杆角度和打击点:

可以切换第三视角、第一视角,以及顶视图:

除此之外还有音乐控制、菜单控制,以及击球后的镜头切换等效果。
这个例子,高下立判!
而且差的不是一丁半点!
另外我还在配额的夹缝里测了一个我自创的项目《天文机械表》。

这个例子,样式也还可以,月相是正确的,计时器、地区这些方面都做得不错。但它把秒表的指针放到了大表盘上,这样就会和秒钟有冲突,该有的小表盘就没有了,还有一个问题是不同地区的日出日落表盘里显示有点问题,另外大表盘上的数字看不太清楚!
这一题整体不如 Fable 5!Fable 5 各种细节都做得很好,几乎可以给满分💯!
我本来想多测几个场景,但是无奈配额已经见底!
这个配额问题真的非常严重:

我做完第一个例子,居然用掉了 37% 的周配额,差不多 2 个五小时周期,也就是说为了跑通这个例子,我至少需要等 5+ 小时!而且它的周配额上限只有 5 倍,真的非常少。
这又能做什么呢~~!
我已经是 100 元一个月了,听说 199 元套餐也不怎么顶用。
我之前跑同样的例子,Fable 5 连一次五小时配额都没用完,Claude 的周配额一般是 5 小时配额的 10 倍,现在应该能到 15 倍。
这么一比,K3 有点高攀不起,只能继续用 Fable 5 勉强度日了😄~
作为用户,模型变强了是好事,但也得考虑“量”和“价”,我们毕竟是真真切切拿来干项目,这点配额,项目还没做完,就先破产了。
总结一下:Kimi K3 是真的强了很多,有些例子表现非常出众,但是有些又很拉跨。而 Fable 5 发挥稳定,整体感觉更稳、更全面,自主性更强,在自由发挥环节中表现很出众,相比而言配额也多得多……离谱!
作为国内用户,如果不差钱的话,K3 是个非常好的模型,不用再翻山越岭去用 Fable 5 了。
其实我是非常想做一次更全面的测试的,但我的“魔法冷却时间”为一周,一周过后可能就没什么人再关心 K3 是什么了。
今天跑了一天高速太累了,就没有录视频效果。上面的例子看动态效果会更直观,我会把相关的例子传到网站上。
大家可以直接去对比,网址:https://topai.jarvisuni.com/
有用过 K3 的,也欢迎来说说它的优点和缺点!