DeepSeek是什么?2026年DeepSeek完整指南


DeepSeek(深度求索)是一家来自中国杭州的 AI 团队。2025 年 1 月,它用一款训练成本号称极低的开源模型 R1,让辉达(Nvidia)股价在单日蒸发近 6,000 亿美元,被市场称为「DeepSeek 时刻」。一年多后,它推出 2026 年的新旗舰 V4,并完成约 70 亿美元融资。这篇指南一次整理:DeepSeek 是谁、模型怎么演进、如何使用、开源到什么程度,以及围绕它的隐私与地缘争议。

DeepSeek 是什么?从幻方量化走出的 AI 团队

DeepSeek 成立于 2023 年 7 月,是中国量化避险基金幻方量化(High-Flyer)分拆出来的 AI 研究团队。幻方本身成立于 2015 年,靠自建 GPU 丛集做量化交易,也因此累积了训练大型模型所需的算力。DeepSeek 创办人兼执行长梁文锋同时是幻方的执行长,透过持股实体握有 DeepSeek 约 84% 股权。公司总部位于杭州,团队刻意维持精简、以研究为导向,2025 年时约仅 160 人。与多数 AI 公司不同,DeepSeek 从一开始就把目标放在通用人工智慧(AGI),而非急于商业化。

在 2026 年首轮融资后,梁文锋的身价据估翻倍至约 360 亿美元,一度被称为全球最富有的 AI 创办人。

2025 年 1 月的「DeepSeek 时刻」:辉达单日蒸发 5,890 亿美元

2025 年 1 月 20 日,DeepSeek 发布主打推理能力的 R1,性能对标 OpenAI 的 o1,却宣称只用了远低于同业的训练算力。恐慌很快传导到市场:1 月 27 日,辉达单日市值蒸发 5,890 亿美元,是美国股市史上单一公司最大单日跌幅,股价重挫约 17%。同一天,DeepSeek 也超越 ChatGPT,登上美国 iOS 免费 App 排行第一。

外界最常引用的「训练成本仅 560 万美元」数字,其实出自 DeepSeek V3 的技术报告,指的只是最终一次正式训练的算力成本,约 2,048 张 H800 GPU、跑约 55 天,并不包含先前的研究、实验、资料与人力等投入。半导体研究机构 SemiAnalysis 估计,DeepSeek 累计的 GPU 资本支出可能高达约 5 亿美元。换句话说,那个小数字是真的,但它是一个很窄的「边际算力」成本,而非 DeepSeek 的全部花费。

模型演进:从 R1 到 2026 年旗舰 V4

DeepSeek 的模型大致分成两条线:以 V 为名的通用模型,以及以 R 为名、专攻推理的模型。从 2024 年的 V2、V3,到 2025 年 1 月引爆话题的 R1,DeepSeek 逐步把「思考」能力整合进主线:2025 年 8 月的 V3.1 首度采用混合思考架构,年底的 V3.2 再导入稀疏注意力(DSA)以提升长文效率。外界一度盛传的独立版 R2 最终没有单独推出,推理能力被并入 V3.1 到 V4 这条混合路线(完整版本可查 DeepSeek 官方更新纪录)。

2026 年,这些线被新旗舰 V4 整合。V4 内建可选的「思考模式」,等于把过去 R1 负责的推理任务也一并吸收。它在 4 月 24 日以预览版亮相,分为效能较强的 V4-Pro 与轻量的 V4-Flash,两者都支援 100 万 token 的上下文长度,足以一次读进整套程式码库或长篇文件。7 月 31 日,DeepSeek 推出 V4-Flash 的正式版,强化了自主代理(agent)能力并再度调降 API 价格;更大的 V4-Pro 正式版,截至 8 月初仍在预览阶段。

V4 最受关注的是效率。根据麻省理工科技评论,V4-Pro 只需要前一代 V3.2 约 27% 的运算量、10% 的记忆体用量,V4-Flash 更压到 10% 运算量、7% 记忆体。效能方面,DeepSeek 称 V4-Pro 可与 Anthropic 的 Claude Opus 4.6、OpenAI 的 GPT-5.4 与 Google 的 Gemini 3.1 等顶级闭源模型并驾齐驱,这些是 DeepSeek 自己公布的跑分,宜视为厂商说法。V4 也特别针对华为升腾(Ascend)等中国国产晶片做了优化。

怎么用 DeepSeek:网页、App、API 与本地部署

一般使用者最简单的方式,是直接用官方网页版 chat.deepseek.com,或下载 DeepSeek 手机 App,介面与 ChatGPT 类似,可免费对话并开启深度思考模式。

开发者则透过 API 串接。DeepSeek 一向以低价著称,以官方公布的价格为例,V4-Flash 每百万 token 输入约 0.14 美元、输出约 0.28 美元;更大的 V4-Pro 输入约 0.44 美元、输出约 0.87 美元,命中快取时还会更低。这样的定价往往只有同级美国闭源模型的数分之一,也是它在开发者之间快速普及的关键。

由于 DeepSeek 开放模型权重,进阶使用者也能把模型下载到本地执行,例如透过 Ollama 在自己的电脑或伺服器上跑,资料不必送上云端。完整的 V4 模型体积庞大、需要高阶硬件,但 DeepSeek 也释出多个体积较小的蒸馏版本,让一般硬件也能尝试。

开源与授权:MIT 权重与蒸馏模型

DeepSeek 的模型权重自 2025 年 1 月起采用宽松的 MIT 授权开放,允许商用与再训练,这也是它被大量采用的原因之一。不过精确地说,DeepSeek 是「开放权重(open-weight)」而非完全「开源」:它公开了模型权重与技术报告,但没有释出训练资料与完整的训练流程。为了让一般硬件也能使用,DeepSeek 还把 R1 的推理能力蒸馏进 1.5B 到 70B 不等的较小模型,这些模型分别以 Qwen 与 Llama 为基础,适合在本地或边缘装置运行。

2026 近况:70 亿美元融资、暂缓二轮与梁文锋的算力论

2026 年 6 月,DeepSeek 完成首轮约 70 亿美元的外部融资,投资方包括腾讯、电池大厂宁德时代(CATL),以及官方背景的国家人工智慧产业投资基金,估值来到约 3,500 亿元人民币。紧接着它启动第二轮、目标至少 100 亿元人民币的募资,投前估值一度上看约 4,800 亿元人民币。

但这轮募资在 7 月按下暂停。导火线是创办人梁文锋在一场投资人会议上的谈话纪录外流:他把中国 AI 与美国的差距归因于算力,而非人才。根据第一财经取得的会议纪录,梁文锋说:「我们与美国最大的差距在于资源。」他表示 DeepSeek 手上约有相当于 2 万张辉达 H 系列 GPU 的算力,并与华为深度合作、透过自研的 TileLang 等工具绕过辉达的 CUDA 生态。管理阶层对非公开言论外流感到挫败,于是口头通知投资人暂缓签约,但未来仍可能重启;该公司也在筹备最快 2026 年底提出的 IPO。

DeepSeek 与 Claude、ChatGPT、Gemini:定位与取舍

和 OpenAI 的 GPT、Anthropic 的 Claude、Google 的 Gemini 这些闭源旗舰相比,DeepSeek 的定位很清楚:开放权重、低价,并在程式、数学与代理任务的跑分上主打「接近前沿,但便宜一个量级」。这些对标顶级模型的效能数字,多半是 DeepSeek 自己公布的结果,宜视为厂商说法而非独立验证。

对开发者来说,DeepSeek 适合成本敏感、想自行部署、或希望避开单一供应商绑定的场景;但若手上的资料涉及隐私或合规敏感,就要把「资料落地中国」与各国公务限制一并纳入考量。简单说,它是目前开放权重阵营里最有份量的选项之一,但用在哪里、用它处理什么资料,需要分开判断。

常见问题

DeepSeek 是哪一国的公司?

DeepSeek 来自中国,总部在杭州,2023 年 7 月由量化避险基金幻方量化分拆成立。

DeepSeek 可以免费用吗?

可以。网页版与手机 App 提供免费对话;开发者串接 API 则依用量计费,但单价偏低。此外模型权重开源,进阶使用者能免费下载到本地运行。

DeepSeek 最新的模型是哪一个?

2026 年的 V4 家族。轻量的 V4-Flash 已于 7 月底推出正式版,更大的旗舰 V4-Pro 截至 8 月初仍在预览阶段。

DeepSeek 训练成本真的只有 560 万美元吗?

那个数字指的是 V3 最终一次正式训练的算力成本,不含研发、实验与人力等投入。累计投入被估计高得多,SemiAnalysis 估其 GPU 资本支出可能达约 5 亿美元。

用 DeepSeek 安全吗?资料会存在中国吗?

托管版会把资料存放在中国境内伺服器,且有政府调取疑虑,多国因此禁止公务使用。若在意隐私,可改用开源权重在本地部署,让资料不外流。

本文链接地址:https://www.wwsww.cn/rgzn/40370.html
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。