H2O EvalGPT – H2O.ai基于Elo评级的大模型自动评估系统与排行榜 H2O EvalGPT是H2O.ai推出的大模型自动评估平台,基于Elo评级和行业基准提供每周更新的透明排行榜,助力模型选型。 00 AI模型评测# A/B测试# AI模型评测# Elo评级
SuperCLUE – 中文大模型综合性测评基准与多维度能力评估 SuperCLUE是权威的中文通用大模型综合性测评基准,通过四大能力象限和12项基础能力对模型进行多维度评估与排名。 00 AI模型评测# AI智能体# AI模型评测# CLUE
FlagEval(天秤) – 智源研究院大模型多维度评测平台与开放基准 FlagEval(天秤)是智源研究院推出的大模型综合评测平台,采用“能力-任务-指标”三维框架,提供多模态自动化评测与权威排行榜。 00 AI模型评测# AI基准测试# AI模型评测# BAAI
Open LLM Leaderboard – Hugging Face大语言模型评测排行榜 Open LLM Leaderboard是Hugging Face平台上的大语言模型性能评测排行榜,为用户提供客观、全面的模型能力对比参考。 00 AI模型评测# AI工具导航# AI模型评测# AI评测基准