帅气的我简直无法用语言描述!
MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系

MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系

MMBench是由顶尖机构联合推出的多模态大模型细粒度评估基准,通过循环评估策略与20项能力维度,全面评测视觉-语言模型性能。
00
CMMLU – 综合性中文大模型评估基准与多学科知识推理测试

CMMLU – 综合性中文大模型评估基准与多学科知识推理测试

CMMLU是专注于评估大模型中文知识与推理能力的综合性基准,涵盖67个学科主题,包含大量中国特定知识题目。
00
OpenCompass – 上海AI实验室大模型开放评测体系与一站式评估平台

OpenCompass – 上海AI实验室大模型开放评测体系与一站式评估平台

OpenCompass是上海AI实验室开源的大模型一站式评测体系,提供评估工具包、基准社区和权威排行榜,推动模型评估标准化
00
AGI-Eval – 大模型评测社区与人类认知能力评估基准

AGI-Eval – 大模型评测社区与人类认知能力评估基准

AGI-Eval是由多所高校联合推出的大模型评测社区,专注于评估模型的人类认知与通用问题解决能力,提供权威榜单与开源评测生态。
00
SuperCLUE – 中文大模型综合性测评基准与多维度能力评估

SuperCLUE – 中文大模型综合性测评基准与多维度能力评估

SuperCLUE是权威的中文通用大模型综合性测评基准,通过四大能力象限和12项基础能力对模型进行多维度评估与排名。
00
FlagEval(天秤) – 智源研究院大模型多维度评测平台与开放基准

FlagEval(天秤) – 智源研究院大模型多维度评测平台与开放基准

FlagEval(天秤)是智源研究院推出的大模型综合评测平台,采用“能力-任务-指标”三维框架,提供多模态自动化评测与权威排行榜。
00
C-Eval – 中文大模型权威评测基准

C-Eval – 中文大模型权威评测基准

C-Eval是由上海交大、清华等高校联合推出的中文大模型标准化评估套件,通过涵盖52个学科的万余道选择题,为模型中文能力提供权威量化基准。
00
Open LLM Leaderboard – Hugging Face大语言模型评测排行榜

Open LLM Leaderboard – Hugging Face大语言模型评测排行榜

Open LLM Leaderboard是Hugging Face平台上的大语言模型性能评测排行榜,为用户提供客观、全面的模型能力对比参考。
00
MagicArena – 字节跳动推出的视觉生成模型对战评测平台

MagicArena – 字节跳动推出的视觉生成模型对战评测平台

MagicArena是字节跳动推出的视觉生成模型对战平台,通过用户投票对比Midjourney、FLUX等模型的图片视频生成效果,并生成动态排行榜。
00
Ollama – 本地运行Llama等开源大模型的命令行工具

Ollama – 本地运行Llama等开源大模型的命令行工具

Ollama是一款开源工具,让开发者能通过简单命令在本地电脑一键下载和运行Llama 2、Mistral等众多开源大语言模型,保障数据隐私。
00
Sora – OpenAI推出的AI视频生成模型

Sora – OpenAI推出的AI视频生成模型

Sora是OpenAI推出的AI视频生成模型,能够根据文本描述生成长达一分钟的高质量、高连贯性视频,模拟物理世界运动。
00
Cherry Studio – 开源全能AI客户端助手

Cherry Studio – 开源全能AI客户端助手

Cherry Studio是一款开源的全能AI桌面客户端,支持聚合管理多平台AI模型、构建本地知识库,并集成AI绘画与翻译等功能。
00