沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

DeepSeek与Grok同日发布新模型:性能提升价格有变,中美大模型价差渐小

2026-08-13来源:天脉网编辑:瑞雪

8月12日,全球人工智能领域迎来重要时刻,DeepSeek与马斯克旗下SpaceXAI同日发布新模型DeepSeek-V4-Pro和Grok 4.6,标志着新一轮大模型竞争进入白热化阶段。从最新评测数据来看,两款新模型均展现出强劲实力,逐步逼近全球顶尖水平,引发行业广泛关注。

DeepSeek-V4-Pro在智能体相关测试中表现尤为突出。根据官方公布的评测结果,与今年4月发布的预览版相比,正式版在多项关键指标上实现显著提升。其中,软件工程能力测试DeepSWE得分从12.8跃升至62.7,高难度数据科学任务测试DSBench-Hard得分从31.1提升至67.2,终端操作能力测试Terminal Bench 2.1得分从72.1提高到87.9,网络安全测试Cybergym得分从52.7增至83.3,HLE带工具测试得分也从48.2上升至60.0。这些数据充分证明,DeepSeek-V4-Pro在复杂任务处理能力上取得重大突破。

在与国际顶尖模型的对比中,DeepSeek-V4-Pro同样表现出色。评测数据显示,该模型在多项测试中超越Anthropic的Claude Opus 4.8,与Fable 5则各有优势。具体来看,在Terminal Bench 2.1测试中,V4-Pro得分87.9,与Fable 5的88.0基本持平;在Cybergym测试中,V4-Pro以83.3分略高于Fable 5的83.1分;但在DSBench-FullStack测试中,V4-Pro得分71.1,略低于Fable 5的77.2分。半导体与AI研究机构SemiAnalysis的评测进一步证实,V4-Pro在Agent任务上的表现大幅领先英伟达Nemotron 3 Ultra,Terminal Bench 2.1测试中,Nemotron 3 Ultra得分53.9,而V4-Pro高达87.9。

除性能提升外,DeepSeek-V4-Pro在功能支持方面也实现全面升级。新模型支持100万Token上下文窗口和最高38.4万Token输出,同时提供思考与非思考两种模式,其中思考模式为默认开启状态。官方API文档显示,V4-Pro还新增工具调用功能,并兼容OpenAI和Anthropic两套API格式,为用户提供更多选择和便利。值得注意的是,尽管性能显著提升,DeepSeek此前预告的API"大幅涨价"并未随V4-Pro正式版上线同步实施。截至最新信息,V4-Pro每百万Token缓存命中输入价格仍为0.025元,缓存未命中输入为3元,输出为6元,与预览版定价保持一致。

与此同时,SpaceXAI发布的新一代模型Grok 4.6也引发市场热议。这款距离上一代Grok 4.5发布仅一个多月的新模型,主要面向长时间运行的AI智能体以及更复杂的交互和视觉任务。AI模型评测机构Artificial Analysis的最新数据显示,Grok 4.6在综合得分上已追平OpenAI旗舰模型GPT-5.6 Sol,两者在最新版本的Artificial Analysis Intelligence Index中均获得61分。这一指数综合了9项关键评测,包括高经济价值职场任务测试GDPval-AA v2、终端操作测试Terminal-Bench v2.1等,能够全面衡量模型的实际应用能力。

在成本控制方面,Grok 4.6展现出显著优势。SpaceXAI公布的价格显示,新模型每百万Token输入和输出价格分别为2美元和6美元,与上一代Grok 4.5保持一致。相比之下,Claude Opus 5的输入和输出价格分别为5美元和25美元,GPT-5.6 Sol则高达5美元和30美元。Artificial Analysis的测算显示,Grok 4.6完成一项智能指数测试任务的平均成本仅为0.84美元,与Kimi K3持平,在性能相当的情况下具有更高的性价比。马斯克在新模型发布后多次在社交平台宣传,称Grok 4.6"智能、快速且性价比超高",在综合考虑智能水平、速度和成本的情况下"客观上是第1"。

行业分析指出,中美大模型市场的竞争格局正在发生深刻变化。摩根士丹利最新研报显示,中国大模型API平均价格过去一年明显上涨,而美国闭源模型价格持续下降,两国大模型价格差距正在收窄。具体来看,2025年一季度,中国大模型输入、输出API均价仅分别占美国同行的6%和5%,到2026年二季度,这一比例已上升至19%和14%。随着中国模型价格上涨和美国厂商继续降价,预计这一差距还将进一步缩小。

研报认为,中国大模型市场的竞争重点正在从"价格战"转向"智力战"。以DeepSeek为例,尽管此前预告将"大幅"上调API价格,但这一调整可能与V4系列需求增强带来的定价能力提升、维持合理毛利以支持前沿模型持续投入等因素有关。随着模型能力和规模继续提升,中国新一代大模型的定价可能进一步上升,行业竞争将更多转向模型能力和算力供给。摩根士丹利强调,"模型智能,而非价格,才是大模型长期竞争地位的关键决定因素",因为头部模型厂商可以推出价格更低、能力稍弱的模型进入大众市场,而普通模型厂商要追赶至最前沿水平则困难得多。

非洲光伏生意血泪后重生:选对太阳能逆变器,让海外实业之路更稳更远
最惨的是有个客户直接把机器拆了拍照给我看,里面全是铜线鼻子发黑、风扇卡死的废料。他还特意指给我看,他们的PCBA板都是自家SMT车间出来的,连插件都是自己做,不是那种东拼西凑的“组装货”。感谢三瑞特,帮我挽回…

2026-08-13

固态电池小试转中试:红木棉以工艺平移与定制产线助力技术落地
红木棉核心优势在于工艺+设备双向打通,区别于单纯的设备制造厂商,团队深度吃透固态电池全流程工艺逻辑,可根据客户已有的小试工艺参数、材料配方、电芯规格,针对性优化中试设备结构与参数,实现小试数据无缝平移、工艺…

2026-08-13

潮汐力油气光纤声学大模型发布,赋能油气行业构建安全监测新体系
潮汐力油气光纤声学大模型在油气场景拥有三大核心优势:一是数据门槛低,仅需传统小模型10%以内的标注数据即可实现更优性能,大幅压缩新管线部署的数据成本与落地周期;二是识别精度高,管道风险事件识别平均准确率提升…

2026-08-13

地下生命密码:蛇纹石化让岩石与水共舞,为生命“烹制”氢能盛宴
2023 年,Schwander、Preiner 与 Martin 等在《Frontiers in Microbiology》提出,蛇纹石化可能为“最后共同祖先”(LUCA)的起源提供了能量、电子、有机质与酸…

2026-08-13

京东携手灵御智能深化合作,TA机器人七鲜上岗开启零售场景智能化新篇
从七鲜门店的场景验证升级为全链路战略合作,本次合作覆盖产品、营销、渠道、产业基建四大维度,构建起从技术研发、场景验证到商业推广的完整产业闭环,为行业提供从实验室到真实场景的完整范本。依托京东多元场景生态与灵…

2026-08-13

第二届世界人形机器人运动会将启 “机器人之家”全方位保障“运动员”
“机器人之家”配备数字化管理体系,推行“一机一码”“一电池一码”,轻轻一扫便可溯源赛队信息、设备参数,30秒就能完成存取登记,让每一位“运动员”都持证上场、有序流转。 人形机器人产业生态训练和测评基地保障场…

2026-08-13

增长非万能,成长最大化才是企业持续发展的核心密码
但这其中有个价值观问题,如果你是采用流氓手段达成用户增长、产品活跃度上升、销售额额增加等商业目标的话,你怎么知道自己不会遭受反噬呢?我们做事业要注意火候和节奏,有时候慢就是快,只要你功夫到了,很多事都是瓜熟…

2026-08-13

康盛股份董事长兼总经理王亚骏取保候审 履职与公司运营均正常
上证报中国证券网讯(陈铭 记者 操子怡)8月12日晚,康盛股份公告称,公司董事长兼总经理王亚骏被司法机关采取取保候审措施,但不影响其履职。 公告称,经核实,上述事项不涉及公司生产经营活动,不涉及公司业务、资产…

2026-08-13

DeepSeek V4 Pro正式版登场:与Grok 4.6同日竞技,性能比肩Claude Fable 5且成本更低
目前,通过 OpenRouter 已经可以直接查看这一版本(https://openrouter.ai/deepseek/deepseek-v4-pro-0813),页面显示该模型支持 100 万 Tok…

2026-08-13