DeepSeek-V4.1-Flash 技术指标报告
Hugging Face · 模型技术指标报告

DeepSeek-V4.1-Flash 技术指标

多模态 MoE 大模型(图像-文本到文本)· 2026-09-10 发布 · 数据来自官方模型卡与模型 API

MIT 许可证 FP8 量化 1M 上下文 552B 骨干 CED 结构
模型 ID
deepseek-ai/DeepSeek-V4.1-Flash
架构
DeepseekV41ForCausalLM
量化
FP8 · 8-bit
分片
48 × safetensors
存储
510.3 GB
创建
2026-09-10 02:17 UTC
更新
2026-09-10 07:17 UTC
Likes
542
总参数量 · checkpoint
484.6B
骨干 552B · 激活 8B / 16B
激活参数 / token
8B / 16B
prefill 8B · decode 16B
上下文窗口
1M
tokens · max_tokens ≥ 256K
预训练语料
45T
tokens · 多模态 · 1M 扩展于 34T
全局 KV 缓存
890B
每 token · ≈ V4-Flash 的 1/4
权重存储
510.3GB
48 分片 · safetensors · FP4 KV
99.6%
checkpoint 权重以 8-bit 精度存储(I8 + FP8),BF16 / F32 合计不足 0.5%
1.7–3.3%
激活参数占总量比例(8B / 16B vs 484.6B),MoE 稀疏激活
1/4 · 1/8
全局 KV 缓存与 SWA 持久缓存占用,均较 V4-Flash 大幅缩减
90.6
Terminal-Bench 2.1 最高分(DSH Minimal 脚手架),代码能力突出
01

架构

CED 结构 · 40 层 Transformer · 多模态 MoE

输入
文本 + 图像
DeepSeek-ViT
视觉编码器 · 2D-RoPE
投影器
2 层 MLP
因果编码器
×20 层 · MoE
解码器
×20 层 · MoE · CSA2
输出
文本
MoE · 1 共享 + 384 路由专家 · 激活 6 个/token CSA2 注意力 · FP4 KV 缓存 · 890 B/token
CED 结构 · 40 层 Transformer · 骨干 552B · FP8 量化 · 上下文 1M · Engram 条件记忆 196B
A1MoE 布局

每层 1 个共享专家 + 384 个路由专家,每 token 激活 6 个路由专家。

激活参数 8B(prefill)/ 16B(decode)
A2CSA2 注意力

压缩稀疏注意力 2,三种静态模式按需切换。

Full · Reindex · Reuse
A3FP4 KV 缓存

E2M1 格式,每 16 通道 1 个 E4M3 缩放因子;全局 890 B/token。

≈ V4-Flash 的 1/4 · SWA 持久缓存 ≈ 1/8
A4Engram + DSpark

Engram 条件记忆(稀疏 token 查找)+ DSpark 投机解码。

Engram 参数 196B
KV 缓存对比 · V4.1-Flash vs V4-Flash
全局 KV 缓存
B / token
V4-Flash
3,560
V4.1-Flash
890
SWA 持久缓存占用
相对值
V4-Flash
V4.1-Flash
全局 KV 缓存 890 B/token ≈ V4-Flash 的 1/4;SWA Bounded Replay 持久缓存占用 ≈ V4-Flash 的 1/8(模型卡未给出绝对值,第二行为相对值)。
02

参数量分布

safetensors checkpoint 按存储精度统计 · 合计 484.6B

权重精度构成(按参数量占比)
hover 查看明细
I8 278.6B 57.5% F8_E4M3 204.0B 42.1% BF16 2.0B 0.41% F32 42.3M 0.01%
8-bit 精度(I8 + F8_E4M3)合计 99.6%;BF16 / F32 合计不足 0.5%。存储 510.3 GB,48 个分片。纹理填充可切换为斜纹编码,便于打印与色觉障碍场景。
03

基准测试

基础模型 20 项 · 指令模型 19 项(reasoning_effort=100)

04

模型对比

指令模型 · max reasoning effort · 与 Opus-5.0 / GPT-5.6 Sol / K3 / GLM-5.3 / DS-V4-Pro / DS-V4-Flash 横向对比

7 / 18
18 项可比基准中取得 7 项第一(含 MathArena Apex 并列);Opus-5.0 同为 7 项
14 / 15
相较 DS-V4-Flash:15 项可比基准中 14 项提升;HLE 纯文本口径 39.1† 高于 37.8†(默认口径 36.8 略低)
90.6
Terminal-Bench 2.1 全场最高:领先 Opus-5.0 1.5 分、DS-V4-Flash 7.9 分
36.8
HLE 知识推理为相对短板:Opus-5.0 56.3、GPT-5.6 Sol 44.5;纯文本口径 39.1†
DS-V4.1-Flash 排名总览
点击任一基准查看全部模型对比
数据来自模型卡前沿模型对比表(max reasoning effort)· temperature=1.0 · top_p=0.95。“—” 表示模型卡未提供该项数据;Codeforces 为 Elo 评分制,未纳入排名与图表,见数据表。
05

脚手架对比

同一模型在不同 agent 脚手架下的表现 · DeepSWE v1.1 与 Terminal-Bench 2.1

DeepSWE v1.1 Terminal-Bench 2.1
DSH(DeepSeek Harness)为官方脚手架;其余为第三方脚手架。数据来自模型卡 Scaffold Performance 表。
06

数据表

全部基准、模型对比与权重明细 · 可横向滚动

类别基准阶段分数备注
精度参数量占比说明
I8278,585,671,68057.5%INT8 存储
F8_E4M3204,015,223,29642.1%FP8 存储
BF161,976,441,8560.41%半精度存储
F3242,307,2820.01%单精度存储
合计484,619,644,114100%存储 510.3 GB · 48 分片
基准 Opus-5.0 GPT-5.6 Sol K3 GLM-5.3 DS-V4-Pro DS-V4-Flash DS-V4.1-Flash
加粗为各基准最高分。† 为 HLE 纯文本子集口径(GLM-5.3 42.0†、DS-V4-Pro 42.7†、DS-V4-Flash 37.8†);DS-V4.1-Flash 纯文本为 39.1†,默认多模态口径 36.8。“—” 表示模型卡未提供。
基准 设置 DS-V4-Flash-Base DS-V4-Pro-Base DS-V4.1-Flash-Base
基础模型对比 · 模型卡内部评测框架口径,shots 因基准而异;差距 ≤ 0.3 视为并列(加粗)。“—” 表示未评测。