PubMedQA – 生物医学问答数据集与模型评测基准平台 PubMedQA是一个开源的生物医学问答数据集与模型评测基准,用于训练和评估AI模型对医学文献的理解能力。 00 AI模型评测# AI模型评测# AI研究工具# GitHub项目
H2O EvalGPT – H2O.ai基于Elo评级的大模型自动评估系统与排行榜 H2O EvalGPT是H2O.ai推出的大模型自动评估平台,基于Elo评级和行业基准提供每周更新的透明排行榜,助力模型选型。 00 AI模型评测# A/B测试# AI模型评测# Elo评级
LLMEval-3 – 复旦大学NLP实验室专业知识大模型评测基准 LLMEval-3是复旦大学NLP实验室推出的专业知识大模型评测基准,覆盖13大学科门类约20万道题目,用于系统评估模型的垂直领域知识深度。 00 AI模型评测# 13学科门类# AI模型评测# LLMEval
LMArena – 加州大学伯克利分校AI模型匿名对比评估 LMArena是加州大学伯克利分校推出的AI模型社区评估平台,通过用户匿名投票对比模型回答来生成实时排行榜,推动评估透明化。 00 AI模型评测# AI模型评测# LMArena# 人类反馈
HELM – 斯坦福大学语言模型整体评估基准与全面评测体系 HELM是斯坦福大学推出的语言模型整体评估基准,通过场景、适配、指标三大模块,系统评估模型在准确率、公平性、毒性等多维度的综合表现。 00 AI模型评测# AI模型评测# GitHub# HELM
C-Eval – 中文大模型权威评测基准 C-Eval是由上海交大、清华等高校联合推出的中文大模型标准化评估套件,通过涵盖52个学科的万余道选择题,为模型中文能力提供权威量化基准。 00 AI模型评测# AI模型评测# AI研究工具# Zero-shot
AGI-Eval – 大模型评测社区与人类认知能力评估基准 AGI-Eval是由多所高校联合推出的大模型评测社区,专注于评估模型的人类认知与通用问题解决能力,提供权威榜单与开源评测生态。 00 AI模型评测# AGI# AI模型评测# DataWhale
MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系 MMBench是由顶尖机构联合推出的多模态大模型细粒度评估基准,通过循环评估策略与20项能力维度,全面评测视觉-语言模型性能。 00 AI模型评测# AI模型评测# GitHub# MMBench
CMMLU – 综合性中文大模型评估基准与多学科知识推理测试 CMMLU是专注于评估大模型中文知识与推理能力的综合性基准,涵盖67个学科主题,包含大量中国特定知识题目。 00 AI模型评测# AI模型评测# CMMLU# GitHub
OpenCompass – 上海AI实验室大模型开放评测体系与一站式评估平台 OpenCompass是上海AI实验室开源的大模型一站式评测体系,提供评估工具包、基准社区和权威排行榜,推动模型评估标准化 00 AI模型评测# AI模型评测# CompassKit# 一站式评估
SuperCLUE – 中文大模型综合性测评基准与多维度能力评估 SuperCLUE是权威的中文通用大模型综合性测评基准,通过四大能力象限和12项基础能力对模型进行多维度评估与排名。 00 AI模型评测# AI智能体# AI模型评测# CLUE
FlagEval(天秤) – 智源研究院大模型多维度评测平台与开放基准 FlagEval(天秤)是智源研究院推出的大模型综合评测平台,采用“能力-任务-指标”三维框架,提供多模态自动化评测与权威排行榜。 00 AI模型评测# AI基准测试# AI模型评测# BAAI
Open LLM Leaderboard – Hugging Face大语言模型评测排行榜 Open LLM Leaderboard是Hugging Face平台上的大语言模型性能评测排行榜,为用户提供客观、全面的模型能力对比参考。 00 AI模型评测# AI工具导航# AI模型评测# AI评测基准
MagicArena – 字节跳动推出的视觉生成模型对战评测平台 MagicArena是字节跳动推出的视觉生成模型对战平台,通过用户投票对比Midjourney、FLUX等模型的图片视频生成效果,并生成动态排行榜。 00 AI图像工具AI模型评测# AI模型评测# AI绘画# FLUX
ModelScope – AI模型社区 ModelScope是阿里达摩院推出的AI模型开源社区,提供海量预训练模型、数据集和开发工具,支持一站式AI模型服务。 00 AI大模型AI开发平台# AI大模型# AI开发平台# AI模型评测