☰
站内
搜索
豆包
DeepSeek
扣子空间
即梦
Bing
百度
Google
搜狗
360
浏览记录
最近浏览
清空
暂无浏览记录
模型评测
H2O EvalGPT
H2O EvalGPT是H2O.ai推出的AI模型评估平台,自动评测大模型在推理、知识、指令遵循、安全等维度的能力,支持基准测试、自定义评估和可视化报告,辅助模型选型与优化。
AI排行榜
模型评测
C
C-Eval
C-Eval是中文大模型综合评测基准,包含13948道多项选择题,覆盖52个学科和4个难度级别,从STEM、人文、社会科学到其他领域全面评估中文大模型的综合能力。
AI排行榜
模型评测
P
PubMedQA
PubMedQA是生物医学领域的问答评测基准,基于PubMed医学文献构建,包含yes/no/maybe三种答案类型,用于测试大模型在医学知识和推理方面的能力。
AI排行榜
模型评测
SuperCLUE
SuperCLUE是CLUE基准平台推出的中文大模型综合评测体系,从逻辑推理、知识运用、语言理解、生成创作、多轮对话、安全等多个维度评估中文大模型能力,并发布公开排名榜单。
AI排行榜
模型评测
A
AGI-Eval
AGI-Eval是通用人工智能(AGI)评测基准,从中文通用能力出发,评估大模型在知识、推理、创作、指令遵循等多维度的表现,提供能力评估和排名。
AI排行榜
模型评测
MMBench
MMBench是OpenCompass推出的多模态大模型评测基准,标准化测试模型的图文理解能力,覆盖感知、认知、推理等能力维度,并发布公开排行榜。
AI排行榜
模型评测
OpenCompass
OpenCompass是上海AI实验室等推出的开源大模型评测体系,支持语言、视觉、多模态等多维度能力评测,覆盖主流评测基准,提供标准化评测流程和公开排行榜。
AI排行榜
模型评测
C
Chatbot Arena
Chatbot Arena是LMSYS推出的众包评测平台,让用户匿名对两个大模型的回答进行投票PK,通过Elo评分算法生成真实用户视角的模型排行榜,被誉为"大模型评测的奥林匹克"。
AI排行榜
模型评测
FlagEval
FlagEval是智源研究院推出的AI模型评测平台,从语言、视觉、多模态等多维度评测大模型能力,提供榜单、趋势分析和分类评测,覆盖国内外主流模型。
AI排行榜
模型评测
MMLU
MMLU(Massive Multitask Language Understanding)是广泛使用的英文大模型评测基准,包含57个学科的15908道题,从STEM到人文社科全面测试模型的知识和推理能力。
AI排行榜
模型评测
HELM
HELM是斯坦福CRFM推出的开源大模型评测框架,在多个基准上从准确性、鲁棒性、公平性、毒性、效率等维度透明评估模型,强调可复现和全面性。
AI排行榜
模型评测
CMMLU
CMMLU是中文大规模多任务语言理解基准,包含67个学科的中文知识题,特别侧重中华文化相关知识的测试,用于评估大模型在中文文化语境下的知识掌握和推理能力。
AI排行榜
模型评测
百川大模型
百川大模型是百川智能自主研发的大模型系列(Baichuan),覆盖开源和商用版本,在中文理解、推理、代码生成等方面表现突出,通过百川智能平台提供对话和API接入。
AI排行榜
模型评测
书生大模型
书生·浦语(InternLM)是上海人工智能实验室推出的开源大模型,支持中英文和多模态,在推理、代码、工具调用等能力上表现突出,提供开源权重和商用授权。
AI排行榜
模型评测
微信扫码访问
复制链接
关闭