CMMLU – 综合性中文大模型评估基准与多学科知识推理测试 CMMLU是专注于评估大模型中文知识与推理能力的综合性基准,涵盖67个学科主题,包含大量中国特定知识题目。 00 AI模型评测# AI模型评测# CMMLU# GitHub
C-Eval – 中文大模型权威评测基准 C-Eval是由上海交大、清华等高校联合推出的中文大模型标准化评估套件,通过涵盖52个学科的万余道选择题,为模型中文能力提供权威量化基准。 00 AI模型评测# AI模型评测# AI研究工具# Zero-shot