DeepSeek 同时提供三种使用方式:网页版对话应用(chat.deepseek.com)、移动应用,以及面向开发者的开放平台 API(platform.deepseek.com)。三者的模型能力保持一致,API 版按 token 用量计费。
deepseek-flash(DeepSeek-V4.1-Flash)成本更低、并发上限更高(2500),并且支持图像理解,适合大批量调用、实时对话与多模态场景。
deepseek-v4-pro(DeepSeek-V4-Pro-0813)面向复杂推理与 Agent 长程任务(终端操作、代码工程、工具编排)优化,质量更高但单价更高、并发上限为 500。
两款模型的上下文长度均为 100 万 token,最大输出长度为 384K token。这意味着单次请求可以喂入长篇文档、大规模代码库或很长的多轮对话历史。
注意区分「上下文长度」(输入 + 输出的总窗口)与「最大输出长度」(单次回复最多能生成多少 token)。
两款模型都支持两种模式,且默认使用思考模式。思考模式让模型在给出最终答案前先进行推理,适合数学、逻辑、多步规划与复杂代码任务;非思考模式直接作答,延迟更低、消耗更少,适合简单问答与高吞吐场景。
此外,FIM 补全(Fill-In-the-Middle)功能仅在非思考模式下支持。
高峰时段为北京时间周一至周五(不含中国法定节假日)的 9:00–12:00 与 14:00–18:00。
其余所有时段——包括夜间、周末以及中国法定节假日全天——都属于空闲时段,价格为高峰时段的一半。
当请求的输入前缀与之前请求重复时,可命中上下文缓存,这部分输入按更低的「缓存命中」单价计费。
缓存命中输入价为 0.02 元 / 百万 tokens(Flash,空闲时段)或 0.15 元 / 百万 tokens(V4-Pro,空闲时段),相比未命中的 1 元 / 4.5 元,降幅可达数十倍。长系统提示词、固定文档与多轮对话场景收益最明显。
费用从充值余额或赠送余额中直接扣减。当两者同时存在时,优先扣减赠送余额。扣减金额 = token 消耗量 × 模型单价。
可以。DeepSeek 提供两种格式的 Base URL:OpenAI 兼容格式为 https://api.deepseek.com,Anthropic 兼容格式为 https://api.deepseek.com/anthropic。只需替换 Base URL 与模型名,现有代码基本无需改动。详见 API 接入。
旧模型名 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 仍可调用,但对应模型已下线,请求会由 DeepSeek-V4.1-Flash 提供服务,并按 Flash 价格计费。新项目请直接使用 deepseek-flash。
产品价格可能发生变动,DeepSeek 保留修改价格的权利。建议以 官方文档的模型 & 价格页 为准,并按实际用量充值。