Hugging Face · 模型技术指标报告
DeepSeek-V4.1-Flash 技术指标
多模态 MoE 大模型(图像-文本到文本)· 2026-09-10 发布 · 数据来自官方模型卡与模型 API
MIT 许可证
FP8 量化
1M 上下文
552B 骨干
CED 结构
总参数量 · checkpoint
484.6B
骨干 552B · 激活 8B / 16B
激活参数 / token
8B / 16B
prefill 8B · decode 16B
上下文窗口
1M
tokens · max_tokens ≥ 256K
预训练语料
45T
tokens · 多模态 · 1M 扩展于 34T
全局 KV 缓存
890B
每 token · ≈ V4-Flash 的 1/4
权重存储
510.3GB
48 分片 · safetensors · FP4 KV
99.6%
checkpoint 权重以 8-bit 精度存储(I8 + FP8),BF16 / F32 合计不足 0.5%
1.7–3.3%
激活参数占总量比例(8B / 16B vs 484.6B),MoE 稀疏激活
1/4 · 1/8
全局 KV 缓存与 SWA 持久缓存占用,均较 V4-Flash 大幅缩减
90.6
Terminal-Bench 2.1 最高分(DSH Minimal 脚手架),代码能力突出
01
架构
CED 结构 · 40 层 Transformer · 多模态 MoE
输入
文本 + 图像
DeepSeek-ViT
视觉编码器 · 2D-RoPE
投影器
2 层 MLP
因果编码器
×20 层 · MoE
解码器
×20 层 · MoE · CSA2
输出
文本
CED 结构 · 40 层 Transformer · 骨干 552B · FP8 量化 · 上下文 1M · Engram 条件记忆 196B
A1MoE 布局
每层 1 个共享专家 + 384 个路由专家,每 token 激活 6 个路由专家。
A2CSA2 注意力
压缩稀疏注意力 2,三种静态模式按需切换。
A3FP4 KV 缓存
E2M1 格式,每 16 通道 1 个 E4M3 缩放因子;全局 890 B/token。
A4Engram + DSpark
Engram 条件记忆(稀疏 token 查找)+ DSpark 投机解码。
KV 缓存对比 · V4.1-Flash vs V4-Flash
全局 KV 缓存
B / token
B / token
SWA 持久缓存占用
相对值
相对值
全局 KV 缓存 890 B/token ≈ V4-Flash 的 1/4;SWA Bounded Replay 持久缓存占用 ≈ V4-Flash 的 1/8(模型卡未给出绝对值,第二行为相对值)。
02
参数量分布
safetensors checkpoint 按存储精度统计 · 合计 484.6B
权重精度构成(按参数量占比)
hover 查看明细
I8 278.6B 57.5%
F8_E4M3 204.0B 42.1%
BF16 2.0B 0.41%
F32 42.3M 0.01%
8-bit 精度(I8 + F8_E4M3)合计 99.6%;BF16 / F32 合计不足 0.5%。存储 510.3 GB,48 个分片。纹理填充可切换为斜纹编码,便于打印与色觉障碍场景。
03
基准测试
基础模型 20 项 · 指令模型 19 项(reasoning_effort=100)
Codeforces 3471Elo 评分制 · 非百分比 · 未纳入条形图
04
模型对比
指令模型 · max reasoning effort · 与 Opus-5.0 / GPT-5.6 Sol / K3 / GLM-5.3 / DS-V4-Pro / DS-V4-Flash 横向对比
7 / 18
18 项可比基准中取得 7 项第一(含 MathArena Apex 并列);Opus-5.0 同为 7 项
14 / 15
相较 DS-V4-Flash:15 项可比基准中 14 项提升;HLE 纯文本口径 39.1† 高于 37.8†(默认口径 36.8 略低)
90.6
Terminal-Bench 2.1 全场最高:领先 Opus-5.0 1.5 分、DS-V4-Flash 7.9 分
36.8
HLE 知识推理为相对短板:Opus-5.0 56.3、GPT-5.6 Sol 44.5;纯文本口径 39.1†
DS-V4.1-Flash 排名总览
点击任一基准查看全部模型对比
数据来自模型卡前沿模型对比表(max reasoning effort)· temperature=1.0 · top_p=0.95。“—” 表示模型卡未提供该项数据;Codeforces 为 Elo 评分制,未纳入排名与图表,见数据表。
05
脚手架对比
同一模型在不同 agent 脚手架下的表现 · DeepSWE v1.1 与 Terminal-Bench 2.1
DeepSWE v1.1
Terminal-Bench 2.1
DSH(DeepSeek Harness)为官方脚手架;其余为第三方脚手架。数据来自模型卡 Scaffold Performance 表。
06
数据表
全部基准、模型对比与权重明细 · 可横向滚动
| 类别 | 基准 | 阶段 | 分数 | 备注 |
|---|
| 精度 | 参数量 | 占比 | 说明 |
|---|---|---|---|
| I8 | 278,585,671,680 | 57.5% | INT8 存储 |
| F8_E4M3 | 204,015,223,296 | 42.1% | FP8 存储 |
| BF16 | 1,976,441,856 | 0.41% | 半精度存储 |
| F32 | 42,307,282 | 0.01% | 单精度存储 |
| 合计 | 484,619,644,114 | 100% | 存储 510.3 GB · 48 分片 |
| 基准 | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | DS-V4-Pro | DS-V4-Flash | DS-V4.1-Flash |
|---|
加粗为各基准最高分。† 为 HLE 纯文本子集口径(GLM-5.3 42.0†、DS-V4-Pro 42.7†、DS-V4-Flash 37.8†);DS-V4.1-Flash 纯文本为 39.1†,默认多模态口径 36.8。“—” 表示模型卡未提供。
| 基准 | 设置 | DS-V4-Flash-Base | DS-V4-Pro-Base | DS-V4.1-Flash-Base |
|---|
基础模型对比 · 模型卡内部评测框架口径,shots 因基准而异;差距 ≤ 0.3 视为并列(加粗)。“—” 表示未评测。