沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

阿里通义千问Qwen CodeElo测试:o1-mini编程力超九成人类程序员

2025-01-04来源:ITBEAR编辑:瑞雪

近日,阿里巴巴旗下的通义千问Qwen团队推出了一个名为CodeElo的基准测试,该测试旨在通过Elo评级系统,对比大语言模型(LLM)与人类程序员的编程能力。

在AI应用场景中,大语言模型的一个关键应用是代码生成与补全。然而,在评估LLM编程能力的真实性方面,业界面临着诸多挑战。现有的基准测试,如LiveCodeBench和USACO,都存在明显的局限性,如缺乏健壮的私有测试用例、不支持专门的判断系统,以及执行环境不一致等问题。

CodeElo基准测试的核心优势在于其全面性、稳健性和标准化。在题目选择上,CodeElo涵盖了广泛的比赛分区、难度级别和算法标签,为LLM提供了全面的评估。在评估方法上,CodeElo利用CodeForces平台的特殊评估机制,确保了对代码准确性的判断,避免了误报等问题,并支持需要特殊评判机制的题目。在评级计算上,CodeElo采用Elo评级系统,根据问题的难度和解决方案的正确性对LLM进行评分,并对错误进行惩罚,从而激励高质量的解决方案。

在对30个开源LLM和3个专有LLM进行测试后,结果显示OpenAI的o1-mini模型表现最为出色,其Elo评分达到了1578,超过了90%的人类参与者。在开源模型中,QwQ-32B-Preview以1261分的成绩位居榜首。然而,这些模型在解决简单问题时仍然表现出一定的困难,通常排名在人类参与者的后20%左右。分析发现,这些模型在数学和实现等类别上表现出色,但在动态规划和树形算法方面存在明显的不足。

测试还发现,当使用C++进行编码时,LLM的表现更为出色,这与竞技程序员的偏好一致。这些结果不仅揭示了LLM在编程能力方面的优势,也指出了其需要改进的领域。通过CodeElo基准测试,我们可以更加清晰地了解LLM在编程竞赛中的表现,并为未来的研究和开发提供有益的参考。

随着技术的不断发展,LLM在编程领域的应用将会越来越广泛。CodeElo基准测试的推出,为评估LLM的编程能力提供了一个新的视角和工具。未来,我们可以期待更多类似的基准测试出现,以推动LLM在编程领域的不断进步和发展。

京东广告携手京东云与华为鲲鹏 共筑高效智能广告技术新未来
三方将聚焦智能广告、大模型及云计算等核心领域,通过京东云计算、广告算法升级、华为鲲鹏技术联合创新,重点破解高并发场景下的广告技术瓶颈,共同构建下一代高效、智能的广告技术基础设施。 再者,此次合作也标志着京东广…

2026-01-07

OpenAI推理模型核心人物Jerry Tworek离职 曾主导GPT-4与Codex开发
Jerry Tworek——构建o3、o1、GPT-4、ChatGPT以及OpenAI首个AI编程模型Codex的关键人物,OpenAI研究副总裁—— 宣布了他的艰难决定: 他 表示,在OpenAI快七…

2026-01-07

Unusual获360万美元早期融资 助力企业精准管理AI模型中的品牌形象
Jack表示,Unusual认为未来需要向AI模型提供关于公司的最佳信息,以便答案能够正确反映品牌和服务。 A:Unusual是一家专注于改变人工智能模型如何谈论品牌的初创公司,帮助客户了解AI模型和服务如…

2026-01-07

哈工大智能冰雕机器人亮相:毫米级精度,破解极寒冰雪建造难题
该机器人能自动化完成大型冰块的提升、抓取、砌筑和喷淋等全流程作业,并实现毫米级搭建精度。一台这样的机器人,其工作效率可替代30名工人,能大幅缩短施工周期、降低成本,为极寒环境下的冰雪建筑施工带来效率突破。机器…

2026-01-06

移远通信SP895BD-AP智能模组发布,以硬核实力赋能AIoT数智升级
该模组搭载高通跃龙™ Q-8750处理器,具备更强大的图形处理能力、更卓越的影像视觉效果和更先进的AI计算性能,能够精准契合视频会议、超高清显示、图像合成、算力板卡、智慧零售以及智能家居等高端设备的严苛需求…

2026-01-06