中文大模型基准测评2024年上半年报告——2024年度中文大模型阶段性进展评估-SuperCLUE团队-2024.7.9-59页

下载本文档

阅读 1007
下载 2
格式 pdf
大小 5.08 MB
约58页
2024-07-18
收藏
评论
点赞(0)
海报
举报

中文大模型基准测评2024年上半年报告——2024年度中文大模型阶段性进展评估-SuperCLUE团队-2024.7.9-59页_第1页

中文大模型基准测评2024年上半年报告——2024年度中文大模型阶段性进展评估-SuperCLUE团队-2024.7.9-59页_第2页

中文大模型基准测评2024年上半年报告——2024年度中文大模型阶段性进展评估-SuperCLUE团队-2024.7.9-59页_第3页

/58

中文大模型基准测评2024年上半年报告—2024年度中文大模型阶段性进展评估SuperCLUE团队2024.07.09精准量化AGI进展，定义人类迈向AGI的路线图AccuratelyquantifyingtheprogressofAGI,definingtheroadmapforhumanity'sjourneytowardsAGI.报告核心结论摘要•国内外大模型差距进一步缩小：国内外大模型差距进一步缩小：OpenAI最新模型GPT-4o依然是全球表现最好的模型，但国内大模型已将差距缩小至5%以内。•国内开源模型崛起：本次登顶SuperCLUE的国内大模型为开源模型Qwen2-72B-Instruct，并且超过了众多国内外闭源模型。•各任务表现：在文科、理科和Hard任务中，GPT-4o综合最佳，Claude-3.5在Hard任务表现突出，Qwen2-72B在文科任务表现优异。•端侧小模型表现惊艳：端侧小模型进展迅速，部分小尺寸模型表现要好于上一代的稍大尺寸模型，极大提升了落地的可行性。SuperCLUE模型象限SuperCLUE各维度任务来源：SuperCLUE,2024年7月9日来源：SuperCLUE,2024年7月9日3目录1.国内大模型关键进展及趋势•2023-2024年大模型关键进展•2024年值得关注的中文大模型全景图•2023-2024年度国内外大模型技术发展趋势2.SuperCLUE通用能力测评•中文大模型基准SuperCLUE介绍•SuperCLUE测评体系及数据集•总榜、理科榜单、文科榜单、Hard榜单及模型象限•开源榜单及端侧小模型榜单•大模型对战胜率、成熟度指数•评测与人类一致性分析3.SuperCLUE多模态能力测评•AIGVBench视频生成测评•SuperCLUE-Image文生图测评•SuperCLUE-V多模态理解测评4.SuperCLUE专项与行业基准测评•各行业、专项测评•未来两个月基准发布计划5.优秀模型案例介绍•优秀...

1、当您付费下载文档后，您只拥有了使用权限，并不意味着购买了版权，文档只能用于自身使用，不得用于其他商业用途（如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利）。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。
3、如文档内容存在违规，或者侵犯商业秘密、侵犯著作权等，请点击“违规举报”。

碎片内容