万科网络科技

17年专业网站建设优化

15850859861

当前位置: 网站首页 > 新闻资讯 > 公司新闻 >

公司新闻

豆包和 DeepSeek 的训练数据有何区别?

泰州网络公司 浏览次数:0 发布时间:2026-09-07

说明:两家都没有完整公开全部训练数据集明细,下面对比基于官方技术报告、公开披露信息,不包含未公开的内部私有语料。豆包底层是字节跳动自研 Seed 系列基座;DeepSeek 是深度求索自研基座。

豆包(Seed) vs DeepSeek 训练数据核心区别

1、数据源构成差异

豆包(Seed)

  1. 中文互联网通用语料占比高:网页、书籍、百科、社区问答、新闻资讯;包含字节生态内合规文本语料,短视频文案、社交对话、生活化网络文本,对网络流行语境、中文口语、日常对话覆盖很强。
  2. 原生多模态数据:预训练混入大量图文、图像‑文本配对数据,这是 DeepSeek 基础版本较弱的一块。
  3. 也包含公开书籍、论文、GitHub 代码,但代码、数学、学术论文不是侧重点;代码主要做基础通用能力,不是专项强化。
  4. 语言:中文优先级更高,兼顾英文,面向国内普通用户场景。

DeepSeek(深度求索)

  1. 专项技术类数据权重很高:大规模精选 GitHub 开源代码、arXiv 计算机 / 数学论文、数学解题数据集(DeepSeek‑Math 专项语料),专门为代码、数学推理、逻辑解题构建大规模高质量子集。
  2. 通用网页来自 Common Crawl 等公开网页库,做多层过滤,优先保留高质量技术、学术文本;相对减少低质量闲聊、碎片化网络口语。
  3. 中英文混合,英文技术文献占比显著高于豆包;基础版文本模型,原生多模态数据少。
  4. 策略:重质量,适度牺牲低价值海量语料,代码与数学是核心数据投入方向。

2、数据侧重点带来的能力差异

3、数据处理与训练范式区别

  1. 豆包 Seed
  1. DeepSeek

4、边界提醒

  1. 两者都用公开网页、书籍、开源代码等公开资源,基础通用知识部分会重叠,差异主要来自各部分语料的权重、筛选偏好、专项数据集。
  2. 微调数据也会造成表现差异:不是只有预训练数据,SFT、RLHF/R1 微调数据同样会改变输出风格。
  3. 没有公开完整数据集,以上是基于公开技术文档总结,无法得到精确百分比。

豆包和 DeepSeek 的训练数据有何区别

上一篇:GEO优化是否必须依赖付费投放?

下一篇:没有了

在线客服
服务热线

服务热线

  15850859861

微信咨询
返回顶部