MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系 MMBench是由顶尖机构联合推出的多模态大模型细粒度评估基准,通过循环评估策略与20项能力维度,全面评测视觉-语言模型性能。 00 AI模型评测# AI模型评测# GitHub# MMBench
OpenCompass – 上海AI实验室大模型开放评测体系与一站式评估平台 OpenCompass是上海AI实验室开源的大模型一站式评测体系,提供评估工具包、基准社区和权威排行榜,推动模型评估标准化 00 AI模型评测# AI模型评测# CompassKit# 一站式评估