HELM – 斯坦福大学语言模型整体评估基准与全面评测体系 HELM是斯坦福大学推出的语言模型整体评估基准,通过场景、适配、指标三大模块,系统评估模型在准确率、公平性、毒性等多维度的综合表现。 00 AI模型评测# AI模型评测# GitHub# HELM
MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系 MMBench是由顶尖机构联合推出的多模态大模型细粒度评估基准,通过循环评估策略与20项能力维度,全面评测视觉-语言模型性能。 00 AI模型评测# AI模型评测# GitHub# MMBench
CMMLU – 综合性中文大模型评估基准与多学科知识推理测试 CMMLU是专注于评估大模型中文知识与推理能力的综合性基准,涵盖67个学科主题,包含大量中国特定知识题目。 00 AI模型评测# AI模型评测# CMMLU# GitHub