地址: 兰州市仓棍之泽110号 邮箱: interrelated@outlook.com 工作时间:上午9点-下午8点

资讯动态

  • 首页
  • Our Portfolio
  • DeepSeek探索“智能密度”的极致实现

DeepSeek探索“智能密度”的极致实现

2026-09-09

DeepSeek给新版本Flash提出了挑战,试图将其Pro版替代。昨日,V4.1版本的Flash开始内测,其新模型结构、原生多模态和更快的速度成为了宣传的亮点。在附带的反馈问卷中,DeepSeek直接询问用户:“你认为这个模型能完全取代线上DeepSeek V4 Pro吗?”这一问题让人对DeepSeek的测试目标有了更深入的思考,究竟Flash能否在效果上超越Pro,成为更经济且适合大规模调用的选择。

Pro与Flash之间的价格差异显著,高峰时段Flash的每百万token收费9元,而Pro则为27元。最近,DeepSeek在其开放平台上宣布,将于9月10日调整Flash系列的价格:在空闲时段,每百万token的缓存命中输入将降至0.02元,未命中输入降至1元,输出降至4元,高峰价格则仍为空闲时段的两倍,降幅分别为60%、大约33%和约11%。新版本的Flash仍在测试能否替代Pro,而其使用门槛已经显著降低。开发者可以为了更好的结果偶尔支付三倍的价格,但在日常使用中,Flash的必要性得到了更多体现。

DeepSeek希望新版本能够集成Pro与Flash的优势:既要快又要强。自R1问世以来,AI的发展得到了更多人的关注,而DeepSeek现在面临的问题是如何使现有的推理能力得到更频繁的利用,推动“智能密度”的重要性。 千亿球友会

在R1于2025年被广泛应用时,其诞生的魅力在于高水平的推理能力得以轻松获取。DeepSeek同时开放了模型权重,使普通用户能够通过“深度思考”应用使用R1,并且开发者可以借此蒸馏自己的模型。高质量推理不再是少数实验室的独有特权,而逐渐融入日常应用。

about image

在2025年5月更新R1时,DeepSeek强调了“思考更深”的重要性。在AIME 2025测试中,新版R1的每题推理token消耗显著提高,从1.2万个增加至2.3万个,准确率也从70%提升至87.5%。虽然推理的时间消耗几乎翻倍,但只要结果值得,这样的等待是可以被接受的。

然而,在2025年12月发布的V3.2报告中,DeepSeek为自己设定了新目标:提升推理链的智能密度。为了达到Gemini 3.0 Pro等模型的输出质量,通常需要更长的推理过程。提高输出的等待时间显得尤为重要,差距不仅体现在速度上,还会影响费用。 千亿球友会

在模型的应用中,小模型与大模型的分工显得尤其突出。V4早期模型指出,Flash在拥有更多推理预算的情况下,能达到接近Pro的表现,但在知识和复杂工作流上仍有差距。小模型的每一步计算成本较低,但往往需要更多的步骤才能实现大模型的效果。开发者所见的价格优势,最终能保留多少则取决于完成任务的方式。

因此,Flash若想取代Pro,必须同时提升能力和效率。更快的生成冗长推理能减少部分等待时间,较早发现有效的方法也能节约后续计算时间。对于频繁使用AI的用户来说,后者同样至关重要。

学术界也已开始将用户等待时间作为优化的一部分。EMNLP 2025的一项研究指出,最优计算方案不一定带来最低延迟,研究人员需要重新调整并行计算和推测解码,以在限定时间内获得更优秀的结果。DeepSeek也在提升生成速度。团队在7月发布的DSpark论文中报告称,在V4-Flash线上用户流量下,与MTP-1基线相比,单用户生成速度提升了60%到85%。团队专注于减少推测解码中的验证浪费,以便用户能够更快速地得到输出,同时兼顾服务的处理能力。 千亿球友会

订阅我们的时事通讯并获取最新消息