沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

英伟达推出6.3万亿Token AI训练数据库,能否重塑大语言模型训练格局?

2025-01-13来源:ITBEAR编辑:瑞雪

英伟达公司近日在其官方博客上宣布了一项重大进展,推出了一款名为Nemotron-CC的大型英文AI训练数据库。这一数据库规模庞大,包含了6.3万亿个Token,其中1.9万亿为精心合成的数据。据英伟达介绍,这一数据库旨在为学术界和企业界提供更为强大的资源,以推动大语言模型的训练进程。

当前,AI模型的性能在很大程度上依赖于其训练数据的质量和数量。然而,现有的公开数据库在规模和质量上往往存在限制,难以满足日益增长的训练需求。英伟达表示,Nemotron-CC正是为了解决这一难题而生。该数据库不仅规模巨大,而且包含大量经过验证的高质量数据,被视为训练大型语言模型的理想选择。

为了验证Nemotron-CC的性能,英伟达进行了多项测试。结果显示,与目前业界领先的公开英文训练数据库DCLM相比,使用Nemotron-CC-HQ训练的模型在MMLU基准测试中的分数提高了5.6分。使用Nemotron-CC训练的80亿参数模型也在MMLU和ARC-Challenge等多个基准测试中取得了显著的成绩提升。

在进一步测试中,该80亿参数模型在MMLU基准测试中分数提升了5分,在ARC-Challenge基准测试中提升了3.1分,并在10项不同任务的平均表现中提高了0.5分。这一成绩甚至超越了基于Llama 3训练数据集开发的Llama 3.1 8B模型,充分展示了Nemotron-CC在训练大型语言模型方面的优势。

英伟达在开发Nemotron-CC的过程中,采用了多种先进技术来确保数据的高质量和多样性。例如,他们使用了模型分类器和合成数据重述等技术来优化数据处理流程。同时,他们还针对特定高质量数据降低了传统的启发式过滤器处理权重,从而进一步提高了数据库中高质量Token的数量,并避免了对模型精确度造成损害。

英伟达已经将Nemotron-CC训练数据库在Common Crawl网站上公开。用户可以通过访问该网站来获取这一数据库。英伟达还表示,相关文档文件将在稍晚时候在其GitHub页面上公布。这将为更多研究人员和开发者提供便利,推动大语言模型的进一步发展。

Valve推出Steam Frame新VR头显 正式宣告上一代Index头显停产
用户可通过无线适配器,将 PC 或 Steam Machine 上的平面屏(flatscreen)及 VR 游戏串流至 SteamFrame;与此同时,Steam Frame 本身也是一款独立设备,搭载高通…

2025-11-14

2025网购流量卡选购指南:不同场景实测教你选到网速稳的好卡
所以,简单概括一下:一张正规的网购流量卡,其网速表现与同运营商的线下套餐并无本质差异。 在流量卡领域,我认为“便宜”不一定直接等于“网速差”。•警惕“物联卡”冒充手机流量卡

2025-11-13

中国电信AI赋能6G发展:创新技术引领通信变革,拓展产业融合新路径
中电信数智科技有限公司“一种基于6G的天地一体化传输优化及拓扑测绘的方法”获国家发明专利授权,这项专利涵盖卫星与地面网络协同通信、频谱资源共享、高效信号传输等多个核心技术领域,为6G的落地应用铺设了一条“高…

2025-11-12

照片压缩至5M内超全指南!七大实用方法助你轻松搞定分享难题
具体的执行步骤是:将它们直接开启,随后去挑选照片,该应用会自动给出推荐的压缩级别,你能去预览最终结果,还能够对某些设置予以调整,比如把分辨率调低或者转换格式,借此令文件大小小于5MB,这对即时分享至社交媒体来…

2025-11-12

企业宽带选不对,带宽再大也白费!这些关键因素决定实际网速
• 网速(用户感知):即实际访问体验,取决于 3 个核心因素 —— 带宽只是基础,更重要的是网络质量、路由优化和并发处理能力。 真正专业的服务商,会从企业实际业务场景出发提供解决方案,而非一味推销高带宽产品…

2025-11-12

荣旭传媒技术破局:以专业方案化解直播痛点,成就高性价比之选
传统方案在视频、音频和网络方面存在诸多不足,而荣旭传媒通过先进的技术和专业的设备,有效解决了这些问题。传统方案的视频分辨率较低,画面不够清晰,而荣旭传媒的4K 超高清视频拍摄制作让画面质量有了质的提升;传统…

2025-11-12

Marantz与B&W组合:以多元功能承载家庭温情,让音乐共鸣融入日常
我在活动上最常遇到来宾,不管是男的,还是女的,他(她)问我:我手机上这些音乐能不能通过蓝牙,或Apple Airplay传到音响播放。 用高级音响回归音乐本身你会发现原来美好的东西就在身边最近我在电脑里找到了…

2025-11-12