微软计划用中国Kimi K3算法替换GPT 开源模型能否全面超越闭源?!在程序员盲测投票的前端代码榜上,Kimi K3超越了Anthropic和OpenAI的顶配闭源模型。Arena的CEO在X上表示,这是“中国开源超越美国闭源的历史时刻”。Kimi K3拥有2.8万亿参数、100万token上下文窗口,是全球首个开源的3万亿级大模型,这些数字引起了硅谷的关注。然而,真正的问题是它能否全面取代GPT和Claude。
从技术性能、用户体验、性价比三个维度来看,K3在前端代码方面表现出色。在Arena.ai的前端代码竞技场,K3通过真实程序员盲测投票夺得第一,超过了Claude Fable 5和GPT-5.6 Sol。用户测试中,K3能够生成复杂的战争场景网页和《我的世界》风格的游戏,甚至完成了芯片设计任务。不过,在复杂算法设计和多步逻辑推理上,K3仍落后于GPT-5.6 Sol约5到8个百分点,且在代码安全审查方面不如Claude Fable 5细致。
K3的100万token上下文窗口能处理大量文本,例如整本《红楼梦》加上三家A股上市公司的十年财报。在长文档摘要和多轮对话一致性测试中,K3的信息召回率接近GPT-5.6 Sol,但在跨章节推理任务上表现稍逊Claude Fable 5。K3在GDPval-AA v2榜上排名第三,综合推理能力较强,但多模态支持目前仅限于图文输入,视频和音频处理尚未开放。
创意写作方面,K3输出较为结构化和模板化,缺乏细腻文笔和创意多样性。在故事创作、广告文案等任务中,K3的表现不如Claude Fable 5和GPT-5.6。当指令包含多个嵌套要求时,K3容易遗漏某些约束,而闭源模型在处理这类任务时更为熟练。
价格方面,K3具有明显优势。API定价为每百万token输入3美元、输出15美元,缓存输入仅需0.30美元每百万token,比同类模型便宜近一半。对于代码生成、长文档处理和技术问答等任务,K3的高性价比优势显著。而在创意写作和市场营销文案等需要情感共鸣和复杂指令遵循的场景中,闭源模型更具优势。
K3在工程代码、长文本处理和性价比上有亮眼表现,但在创意写作和复杂指令遵循上与顶配闭源模型仍有差距。企业可以根据具体需求选择混合使用策略,充分利用各模型的优势。开源生态的迭代速度较快,社区共同改进功能,几个月就能更新一版。现阶段,理性的选择不是全换或不换,而是根据实际场景需求做出决策。
8月8日,ChatGPT-5上线后,OpenAI停用了GPT-4o版本,引发用户争议。社交媒体上出现了不少关于GPT-5使用感不佳的吐槽,甚至有用户呼吁恢复GPT-4o
2025-08-10 11:28:35GPT-5上线遭滑铁卢人工智能GPT一4跌下神坛!北大韦东奕出题,GPT一4挑战失败。
2023-03-29 09:50:59韦东奕出题难倒GPT-4