HELM – 斯坦福大学语言模型整体评估基准与全面评测体系 HELM是斯坦福大学推出的语言模型整体评估基准,通过场景、适配、指标三大模块,系统评估模型在准确率、公平性、毒性等多维度的综合表现。 00 AI模型评测# AI模型评测# GitHub# HELM
MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系 MMBench是由顶尖机构联合推出的多模态大模型细粒度评估基准,通过循环评估策略与20项能力维度,全面评测视觉-语言模型性能。 00 AI模型评测# AI模型评测# GitHub# MMBench
AGI-Eval – 大模型评测社区与人类认知能力评估基准 AGI-Eval是由多所高校联合推出的大模型评测社区,专注于评估模型的人类认知与通用问题解决能力,提供权威榜单与开源评测生态。 00 AI模型评测# AGI# AI模型评测# DataWhale