沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

Meta携手斯坦福,Apollo模型让AI视频理解能力大飞跃!

2024-12-18来源:ITBEAR编辑:瑞雪

近日,科技巨头meta与斯坦福大学携手,共同推出了一个名为Apollo的全新AI模型系列,这一创新成果在提升机器对视频内容的理解能力上取得了显著突破。

长久以来,尽管人工智能在图像处理和文本分析领域取得了长足进步,但让机器真正“看懂”视频仍然是一个极具挑战性的难题。视频中包含的动态信息错综复杂,处理起来不仅需要强大的计算能力作为支撑,更需要在系统设计层面进行精细化的考量。

针对视频处理的复杂性,Apollo模型采用了双组件设计。其中一个组件专注于分析单个视频帧的内容,而另一个组件则负责追踪对象和场景随时间的变化。这种设计思路使得Apollo能够更全面地捕捉视频中的信息。

在模型训练方面,meta与斯坦福大学的研究团队发现,训练方法的选择比单纯追求模型规模更为重要。Apollo模型采用了分阶段训练策略,按顺序激活模型的不同部分,这种训练方法相较于一次性训练所有部分,能够取得更好的效果。

研究团队还对数据组合进行了不断优化。他们发现,当数据组合中文本数据占比约为10%~14%,且其余部分略微偏向视频内容时,能够最好地平衡语言理解和视频处理能力。这一发现为Apollo模型的训练提供了有力的数据支持。

Apollo模型在不同规模上均展现出了卓越的性能。其中,较小的Apollo-3B模型已经超越了同等规模的Qwen2-VL等模型,而更大的Apollo-7B模型更是超过了参数更大的同类模型。这一系列成就充分证明了Apollo模型在视频理解领域的领先地位。

为了推动AI技术的进一步发展,meta已经开源了Apollo模型的代码和模型权重,并在Hugging Face平台上提供了公开演示。这一举措将有助于更多开发者和研究人员深入了解Apollo模型的工作原理,并基于其进行更深入的研究和应用开发。

Valve推出Steam Frame新VR头显 正式宣告上一代Index头显停产
用户可通过无线适配器,将 PC 或 Steam Machine 上的平面屏(flatscreen)及 VR 游戏串流至 SteamFrame;与此同时,Steam Frame 本身也是一款独立设备,搭载高通…

2025-11-14

2025网购流量卡选购指南:不同场景实测教你选到网速稳的好卡
所以,简单概括一下:一张正规的网购流量卡,其网速表现与同运营商的线下套餐并无本质差异。 在流量卡领域,我认为“便宜”不一定直接等于“网速差”。•警惕“物联卡”冒充手机流量卡

2025-11-13

中国电信AI赋能6G发展:创新技术引领通信变革,拓展产业融合新路径
中电信数智科技有限公司“一种基于6G的天地一体化传输优化及拓扑测绘的方法”获国家发明专利授权,这项专利涵盖卫星与地面网络协同通信、频谱资源共享、高效信号传输等多个核心技术领域,为6G的落地应用铺设了一条“高…

2025-11-12

照片压缩至5M内超全指南!七大实用方法助你轻松搞定分享难题
具体的执行步骤是:将它们直接开启,随后去挑选照片,该应用会自动给出推荐的压缩级别,你能去预览最终结果,还能够对某些设置予以调整,比如把分辨率调低或者转换格式,借此令文件大小小于5MB,这对即时分享至社交媒体来…

2025-11-12

企业宽带选不对,带宽再大也白费!这些关键因素决定实际网速
• 网速(用户感知):即实际访问体验,取决于 3 个核心因素 —— 带宽只是基础,更重要的是网络质量、路由优化和并发处理能力。 真正专业的服务商,会从企业实际业务场景出发提供解决方案,而非一味推销高带宽产品…

2025-11-12

荣旭传媒技术破局:以专业方案化解直播痛点,成就高性价比之选
传统方案在视频、音频和网络方面存在诸多不足,而荣旭传媒通过先进的技术和专业的设备,有效解决了这些问题。传统方案的视频分辨率较低,画面不够清晰,而荣旭传媒的4K 超高清视频拍摄制作让画面质量有了质的提升;传统…

2025-11-12

Marantz与B&W组合:以多元功能承载家庭温情,让音乐共鸣融入日常
我在活动上最常遇到来宾,不管是男的,还是女的,他(她)问我:我手机上这些音乐能不能通过蓝牙,或Apple Airplay传到音响播放。 用高级音响回归音乐本身你会发现原来美好的东西就在身边最近我在电脑里找到了…

2025-11-12