FlagEval
FlagEval是智源研究院推出的AI模型评测平台,从语言、视觉、多模态等多维度评测大模型能力,提供榜单、趋势分析和分类评测,覆盖国内外主流模型。
FlagEval是智源研究院(BAAI)推出的AI模型评测平台。智源是北京智源人工智能研究院,国内知名的AI研究机构,FlagEval是它对大模型能力评估的解决方案。
FlagEval覆盖语言、视觉、多模态等多个维度,提供公开榜单和趋势分析,既能看到模型的当前排名,也能追踪能力随时间的变化趋势,帮助科研和产业界了解模型进展。
核心功能
多维度评测:从语言、视觉、多模态等维度评测大模型能力。
公开榜单:发布国内外主流模型的排名。
趋势分析:追踪模型能力的动态变化。
分类评测:按能力维度分类评估,了解模型强弱项。
模型覆盖:覆盖国内外主流大模型。
使用教程
- 访问flageval.baai.ac.cn查看评测平台。
- 浏览模型榜单和各维度表现。
- 查看趋势分析,了解能力变化。
- 对比国内外模型的差异。
优点
- 出自智源研究院,专业权威。
- 多维度和分类评测,细致全面。
- 有趋势分析,不仅看静态排名。
- 覆盖国内外主流模型。
需要注意的地方
- 评测标准和榜单会随版本迭代更新。
- 结果作为参考,实际选型需结合业务。
适合谁用
研究者、大模型开发团队、AI产品经理、关注模型进展的从业者和企业选型人员。
定价
FlagEval评测结果和榜单公开,免费查看。
同类型产品对比
| 产品 | 价格/模式 | 核心特点 | 适合人群 |
|---|---|---|---|
| FlagEval | 免费 | 多维评测、趋势分析 | 研究者、企业 |
| OpenCompass | 开源 | 一站式多维评测 | 研究者、开发团队 |
| SuperCLUE | 免费 | 中文综合评测、排名 | 中文模型选型 |
| Chatbot Arena | 免费 | 匿名对战、用户视角 | 用户体验对比 |
常见问题
FlagEval是什么
FlagEval是智源研究院推出的AI模型评测平台,从语言、视觉、多模态等多维度评测大模型能力。
FlagEval评测哪些维度
覆盖语言、视觉、多模态等多个维度,并提供分类评测。
FlagEval和OpenCompass有什么区别
FlagEval是智源的评测平台,强调榜单和趋势分析;OpenCompass是开源评测框架,强调可定制和私有化。
FlagEval是免费的吗
评测结果和榜单免费公开查看。
FlagEval适合谁用
适合研究者、大模型开发团队、AI产品经理和企业选型人员。
引用来源
- FlagEval官网:https://flageval.baai.ac.cn/#/trending
- FlagEval介绍:https://kcool.cn/flag-eval






