DeepSeek(深度求索)是一支来自中国杭州的 AI 团队。2025 年 1 月,它凭借一款训练成本极低的开源模型 R1,令辉达(Nvidia)股价在单日内蒸发近 6,000 亿美元,这一事件被市场称为「DeepSeek 时刻」。一年多后,它推出了 2026 年的新旗舰 V4,并成功完成约 70 亿美元的融资。本指南将全面整理以下内容:<br>1. DeepSeek 是谁<br>2. 模型演进的历程<br>3. 如何使用<br>4. 开源的程度<br>5. 围绕它的隐私与地缘争议
DeepSeek 成立于 2023 年 7 月,是中国量化避险基金幻方量化(High-Flyer)分拆出来的 AI 研究团队。幻方本身成立于 2015 年,靠自建 GPU 丛集做量化交易,也因此累积了训练大型模型所需的算力。DeepSeek 创办人兼执行长梁文锋同时是幻方的执行长,透过持股实体握有 DeepSeek 约 84% 股权。公司总部位于杭州,团队刻意维持精简、以研究为导向,2025 年时约仅 160 人。与多数 AI 公司不同,DeepSeek 从一开始就把目标放在通用人工智慧(AGI),而非急于商业化。
在 2026 年首轮融资后,梁文锋的身价据估翻倍至约 360 亿美元,一度被称为全球最富有的 AI 创办人。
2025 年 1 月 20 日,DeepSeek 发布主打推理能力的 R1,性能对标 OpenAI 的 o1,却宣称只用了远低于同业的训练算力。恐慌很快传导到市场:1 月 27 日,辉达单日市值蒸发 5,890 亿美元,是美国股市史上单一公司最大单日跌幅,股价重挫约 17%。同一天,DeepSeek 也超越 ChatGPT,登上美国 iOS 免费 App 排行第一。
外界最常引用的「训练成本仅 560 万美元」数字,其实出自 DeepSeek V3 的技术报告,指的只是最终一次正式训练的算力成本,约 2,048 张 H800 GPU、跑约 55 天,并不包含先前的研究、实验、资料与人力等投入。半导体研究机构 SemiAnalysis 估计,DeepSeek累计的 GPU 资本支出可能高达约 5 亿美元。换句话说,那个小数字是真的,但它是一个很窄的「边际算力」成本,而非 DeepSeek 的全部花费。
DeepSeek 的模型大致分成两条线:以 V 为名的通用模型,以及以 R 为名、专攻推理的模型。从 2024 年的 V2、V3,到 2025 年 1 月引爆话题的 R1,DeepSeek 逐步把「思考」能力整合进主线:2025 年 8 月的 V3.1 首度采用混合思考架构,年底的 V3.2 再导入稀疏注意力(DSA)以提升长文效率。外界一度盛传的独立版 R2 最终没有单独推出,推理能力被并入 V3.1 到 V4 这条混合路线(完整版本可查DeepSeek 官方更新纪录)。
2026 年,这些线被新旗舰V4整合。V4 内建可选的「思考模式」,等于把过去 R1 负责的推理任务也一并吸收。它在 4 月 24 日以预览版亮相,分为效能较强的 V4-Pro 与轻量的 V4-Flash,两者都支援 100 万 token 的上下文长度,足以一次读进整套程式码库或长篇文件。7 月 31 日,DeepSeek 推出V4-Flash 的正式版,强化了自主代理(agent)能力并再度调降 API 价格;更大的 V4-Pro 正式版,截至 8 月初仍在预览阶段。
V4 最受关注的是效率。根据麻省理工科技评论,V4-Pro 只需要前一代 V3.2 约 27% 的运算量、10% 的记忆体用量,V4-Flash 更压到 10% 运算量、7% 记忆体。效能方面,DeepSeek 称 V4-Pro 可与 Anthropic 的Claude Opus 4.6、OpenAI 的GPT-5.4与 Google 的Gemini 3.1等顶级闭源模型并驾齐驱,这些是 DeepSeek 自己公布的跑分,宜视为厂商说法。V4 也特别针对华为升腾(Ascend)等中国国产晶片做了优化。
一般使用者最简单的方式,是直接用官方网页版 chat.deepseek.com,或下载 DeepSeek 手机 App,介面与 ChatGPT 类似,可免费对话并开启深度思考模式。
开发者则透过 API 串接。DeepSeek 一向以低价著称,以官方公布的价格为例,V4-Flash 每百万 token 输入约 0.14 美元、输出约 0.28 美元;更大的 V4-Pro 输入约 0.44 美元、输出约 0.87 美元,命中快取时还会更低。这样的定价往往只有同级美国闭源模型的数分之一,也是它在开发者之间快速普及的关键。
由于 DeepSeek 开放模型权重,进阶使用者也能把模型下载到本地执行,例如透过Ollama在自己的电脑或伺服器上跑,资料不必送上云端。完整的 V4 模型体积庞大、需要高阶硬件,但 DeepSeek 也释出多个体积较小的蒸馏版本,让一般硬件也能尝试。
DeepSeek 的模型权重自 2025 年 1 月起采用宽松的MIT 授权开放,允许商用与再训练,这也是它被大量采用的原因之一。不过精确地说,DeepSeek 是「开放权重(open-weight)」而非完全「开源」:它公开了模型权重与技术报告,但没有释出训练资料与完整的训练流程。为了让一般硬件也能使用,DeepSeek 还把 R1 的推理能力蒸馏进 1.5B 到 70B 不等的较小模型,这些模型分别以 Qwen 与 Llama 为基础,适合在本地或边缘装置运行。
2026 年 6 月,DeepSeek 完成首轮约 70 亿美元的外部融资,投资方包括腾讯、电池大厂宁德时代(CATL),以及官方背景的国家人工智慧产业投资基金,估值来到约 3,500 亿元人民币。紧接着它启动第二轮、目标至少 100 亿元人民币的募资,投前估值一度上看约 4,800 亿元人民币。
但这轮募资在 7 月按下暂停。导火线是创办人梁文锋在一场投资人会议上的谈话纪录外流:他把中国 AI 与美国的差距归因于算力,而非人才。根据第一财经取得的会议纪录,梁文锋说:「我们与美国最大的差距在于资源。」他表示 DeepSeek 手上约有相当于 2 万张辉达 H 系列 GPU 的算力,并与华为深度合作、透过自研的 TileLang 等工具绕过辉达的 CUDA 生态。管理阶层对非公开言论外流感到挫败,于是口头通知投资人暂缓签约,但未来仍可能重启;该公司也在筹备最快 2026 年底提出的 IPO。
和 OpenAI 的 GPT、Anthropic 的 Claude、Google 的 Gemini 这些闭源旗舰相比,DeepSeek 的定位很清楚:开放权重、低价,并在程式、数学与代理任务的跑分上主打「接近前沿,但便宜一个量级」。这些对标顶级模型的效能数字,多半是 DeepSeek 自己公布的结果,宜视为厂商说法而非独立验证。
对开发者来说,DeepSeek 适合成本敏感、想自行部署、或希望避开单一供应商绑定的场景;但若手上的资料涉及隐私或合规敏感,就要把「资料落地中国」与各国公务限制一并纳入考量。简单说,它是目前开放权重阵营里最有份量的选项之一,但用在哪里、用它处理什么资料,需要分开判断。
DeepSeek 来自中国,总部在杭州,2023 年 7 月由量化避险基金幻方量化分拆成立。
可以。网页版与手机 App 提供免费对话;开发者串接 API 则依用量计费,但单价偏低。此外模型权重开源,进阶使用者能免费下载到本地运行。
2026 年的 V4 家族。轻量的 V4-Flash 已于 7 月底推出正式版,更大的旗舰 V4-Pro 截至 8 月初仍在预览阶段。
那个数字指的是 V3 最终一次正式训练的算力成本,不含研发、实验与人力等投入。累计投入被估计高得多,SemiAnalysis 估其 GPU 资本支出可能达约 5 亿美元。
托管版会把资料存放在中国境内伺服器,且有政府调取疑虑,多国因此禁止公务使用。若在意隐私,可改用开源权重在本地部署,让资料不外流。