中文大模型基准测评2024年上半年报告—2024年度中文大模型阶段性进展评估SuperCLUE团队2024.07.09精准量化AGI进展,定义人类迈向AGI的路线图AccuratelyquantifyingtheprogressofAGI,definingtheroadmapforhumanity'sjourneytowardsAGI.报告核心结论摘要•国内外大模型差距进一步缩小:国内外大模型差距进一步缩小:OpenAI最新模型GPT-4o依然是全球表现最好的模型,但国内大模型已将差距缩小至5%以内。•国内开源模型崛起:本次登顶SuperCLUE的国内大模型为开源模型Qwen2-72B-Instruct,并且超过了众多国内外闭源模型。•各任务表现:在文科、理科和Hard任务中,GPT-4o综合最佳,Claude-3.5在Hard任务表现突出,Qwen2-72B在文科任务表现优异。•端侧小模型表现惊艳:端侧小模型进展迅速,部分小尺寸模型表现要好于上一代的稍大尺寸模型,极大提升了落地的可行性。SuperCLUE模型象限SuperCLUE各维度任务来源:SuperCLUE,2024年7月9日来源:SuperCLUE,2024年7月9日3目录1.国内大模型关键进展及趋势•2023-2024年大模型关键进展•2024年值得关注的中文大模型全景图•2023-2024年度国内外大模型技术发展趋势2.SuperCLUE通用能力测评•中文大模型基准SuperCLUE介绍•SuperCLUE测评体系及数据集•总榜、理科榜单、文科榜单、Hard榜单及模型象限•开源榜单及端侧小模型榜单•大模型对战胜率、成熟度指数•评测与人类一致性分析3.SuperCLUE多模态能力测评•AIGVBench视频生成测评•SuperCLUE-Image文生图测评•SuperCLUE-V多模态理解测评4.SuperCLUE专项与行业基准测评•各行业、专项测评•未来两个月基准发布计划5.优秀模型案例介绍•优秀...
发表评论取消回复