简单锐评一下现在的各大AI模型
帖子发出去之后,有不少小伙伴来找过我问了一些 AI 相关的问题,有很大一部分是关于 AI 模型选择方面的。基于我自己的个人使用体验,简单锐评一下目前市面上的各大 AI 模型。
夯
claude-fable-5:目前最强模型,一两句提示词就能达到和预期相同的效果,贵不是它的问题是我的问题。在涉及网络安全和生物学的问题时,会降级到 opus 模型。试过给它读取某款游戏,自研引擎网上没有资料可查,它自己可以做到 90% 以上还原复刻出一个网页版本的游戏。
gpt-5.6-sol:性价比最高的强力模型,也是我目前的主力。其实我不太喜欢,最高推理强度下速度非常慢,并且不说人话(没有活人感),谁让我用不起 fable 5 呢。任务是真的能给你做好,解决问题的能力极强,PC 端的游戏汉化方面估计只要游戏本身没有特别复杂的加密,都可以完成。

顶级
claude-opus-5/claude-opus-4-6:能力和 fable 5 不相上下,能解决复杂推理问题,活人感很强。opus 4.6 比较适合用于写作,写小说、写论文、写总结报告,水平都非常出色,逻辑清晰,用词精准。目前我自己写各种材料的主力模型,真感觉我自己改半天还不如 opus 写一遍。角色扮演方面最强模型。

kimi-k3:当前最强的国产模型,前端能力断档领先。发售之后一直不太好买,性价比也不算太高,推理能力没有太亮眼的表现(但是属于国模最强了)。我自己主要是拿来写点文档材料(在办公软件使用方面,国模里 Kimi 也是最强的),写写网页前端,效果是真的很出色。也是我目前最看好的国模。
grok-4.5:也是做到了三色图(好用+快速+便宜),道德底线极低。注意力并不是很高,在小任务方面表现出色,大型任务就很一般(能跑,效果没有预期的好)。在写前端方面能力也还算不错,快赶上 Gemini 的水平。速度飞快,用 Grok 处理一些简单的小任务挺合适,比如文本翻译。角色扮演方面也是好手。

gpt-image-2:当前最强的生图模型,对提示词要求不高就能轻松出好图。由于目前官方砍掉了订阅渠道的 2K、4K 出图,只能出 1K 图,就导致现在有些时候中文还是会糊掉,这一点不太好。平时日常使用、PPT 汇报用图直接 GPT 出图都可以,有挑选过的话很难分辨出是 AI 生图。

doubao-seedance-2-0:最强视频生成模型,没什么好说的,优质 AI 视频的唯一选择。
人上人
gpt-5.6-terra:写文档和日常办公方面完全可以胜任,在今天降价之后更有性价比了。比如已经跑通、不太需要额外研究的流程,都可以直接交给 terra 完成;它能很好地遵循指令,基本不会出现差错。
gpt-5.6-luna:今天这款模型降价了 80%,有点 luna max 王朝的感觉。简单任务(比如文本翻译)都是它的舒适区,又快又好又便宜。
deepseek-v4:相当有潜力的模型,preview 版本还不太适合作为生产力工具,在角色扮演方面表现出色。规划好的任务可以遵循指令,不适合让它自己探索规划。平时拿来聊聊天是个不错的选择,也可以用作快速的文本翻译模型,价格也很亲民。可以期待一波正式版本的表现,应该有实力跃升到顶级的水平。
更新: deepseek-v4-flash 的正式版出了,没想到已经有一大批模型进入“AI 斩杀线”了(在虚线框内的模型性能或者价格都打不过 deepseek-v4-flash)。不过,根据实际体验来看,定位上仍然是一款快速模型。更适合做简单聊天或者文本翻译,不适合完成复杂任务和编程。

gemini-2.5-pro:一个比较特例的情况,老模型甚至在某些方面优于新模型。虽然在推理和解决问题方面表现不佳,但是文字能力强,再加上一些“恰到好处”的 AI 幻觉,拿来写小说、翻译文本确实是个不错的选择,角色扮演效果也很棒。很适合对逻辑要求不高的场景,价格也便宜。
NPC
claude-sonnet-5:很遗憾,这款模型虽然在能力上超过了多数人上人系列的模型,但是确实没有太多适合的使用场景,都有更合适的上位替代了。论解决问题和推理,能力比不过 terra,价格更是被 terra 秒杀。模型自身的幻觉相对比较严重,从 4.5 之后的版本迭代都没有明显提升。
minimax-m3:没有太大亮点的一款模型,各方面表现平平无奇。但是要说 MiniMax 的语音生成模型我觉得还不错,如果要给游戏做配音,倒是个不错的选择,兼顾效果和成本。
mimo-2.5-pro:和 MiniMax 情况差不多,不笨,但是也不强,价格方面更是没有了优势。
claude-haiku-4-5:适合作为快速翻译模型,速度很快,但是价格并不怎么便宜。
拉完了
gemini-3.1-pro/gemini-3.6-flash/大香蕉:在半年前,Google 还是 AI 模型“御三家”成员,当时的 Gemini 模型确实有比较强的竞争力。可惜半年之后,几乎没有什么进步提升,还在原地踏步,当前网页版本的 Gemini 注意力非常差,预告过本月推出的 gemini-3.5-pro 也没有了后续消息。大香蕉生图的效果也被 GPT 超过,全方位拉胯了。

glm-5.2:曾经的国模之光,今天又一轮的涨价之后,已经完全失去了竞争力。GLM 系列在 5.0 之后明显转向编程特化;4.7 及更早的版本还有其他用途,5 系列则基本奔着 coding 去了。能力上已经完全被 luna max 碾压,价格上贵出不知道几十倍,甚至官网套餐还是饥饿营销+买了不能用。
doubao-seed-2-1-pro:我直接给你,最直白、最清晰、最实用、最不绕弯、最不玄学、最不啰嗦、最不搞虚的,最一针见血、最通俗易懂、最简洁明了、最直击重点、最靠谱、最稳妥、最核心、最关键、最透彻、最精炼、最落地、最不花哨、最不复杂的结论:豆包拉完了。(其实 API 版本的豆包在文字方面的能力还是可以的,比起网页版本要强很多,可惜 API 版本的价格实在是贵上天了)
