AI工具导航
  • AI工具集
    • AI写作工具
    • AI图像工具
    • AI视频工具
    • AI办公工具
    • AI智能体
    • AI聊天助手
    • AI编程工具
    • AI开发平台
    • AI设计工具
    • AI音频工具
    • AI搜索引擎
    • AI大模型
    • API中转站
  • 小红书工具
    • 小红书笔记图片内容提取
  • AI资讯
      • 未登录
        登录后即可体验更多功能
    • AI工具集
      • AI写作工具
      • AI图像工具
      • AI视频工具
      • AI办公工具
      • AI智能体
      • AI聊天助手
      • AI编程工具
      • AI开发平台
      • AI设计工具
      • AI音频工具
      • AI搜索引擎
      • AI大模型
      • API中转站
    • 小红书工具
      • 小红书笔记图片内容提取
    • AI资讯
    未登录
    登录后即可体验更多功能

    AI模型评测

    共 15 篇网址
    AI聊天助手API中转站AI资讯站AI写作工具AI图像工具AI视频工具AI办公工具AI智能体AI编程工具AI开发平台AI设计工具AI音频工具AI搜索引擎AI大模型AI学习网站AI模型评测AI内容检测AI提示指令
    排序
    发布更新浏览点赞
    PubMedQA – 生物医学问答数据集与模型评测基准平台

    PubMedQA – 生物医学问答数据集与模型评测基准平台

    PubMedQA是一个开源的生物医学问答数据集与模型评测基准,用于训练和评估AI模型对医学文献的理解能力。
    00
    AI模型评测# AI模型评测# AI研究工具# GitHub项目
    H2O EvalGPT – H2O.ai基于Elo评级的大模型自动评估系统与排行榜

    H2O EvalGPT – H2O.ai基于Elo评级的大模型自动评估系统与排行榜

    H2O EvalGPT是H2O.ai推出的大模型自动评估平台,基于Elo评级和行业基准提供每周更新的透明排行榜,助力模型选型。
    00
    AI模型评测# A/B测试# AI模型评测# Elo评级
    LLMEval-3 – 复旦大学NLP实验室专业知识大模型评测基准

    LLMEval-3 – 复旦大学NLP实验室专业知识大模型评测基准

    LLMEval-3是复旦大学NLP实验室推出的专业知识大模型评测基准,覆盖13大学科门类约20万道题目,用于系统评估模型的垂直领域知识深度。
    00
    AI模型评测# 13学科门类# AI模型评测# LLMEval
    LMArena – 加州大学伯克利分校AI模型匿名对比评估

    LMArena – 加州大学伯克利分校AI模型匿名对比评估

    LMArena是加州大学伯克利分校推出的AI模型社区评估平台,通过用户匿名投票对比模型回答来生成实时排行榜,推动评估透明化。
    00
    AI模型评测# AI模型评测# LMArena# 人类反馈
    HELM – 斯坦福大学语言模型整体评估基准与全面评测体系

    HELM – 斯坦福大学语言模型整体评估基准与全面评测体系

    HELM是斯坦福大学推出的语言模型整体评估基准,通过场景、适配、指标三大模块,系统评估模型在准确率、公平性、毒性等多维度的综合表现。
    00
    AI模型评测# AI模型评测# GitHub# HELM
    MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系

    MMBench – 全方位多模态大模型能力评测基准与细粒度评估体系

    MMBench是由顶尖机构联合推出的多模态大模型细粒度评估基准,通过循环评估策略与20项能力维度,全面评测视觉-语言模型性能。
    00
    AI模型评测# AI模型评测# GitHub# MMBench
    CMMLU – 综合性中文大模型评估基准与多学科知识推理测试

    CMMLU – 综合性中文大模型评估基准与多学科知识推理测试

    CMMLU是专注于评估大模型中文知识与推理能力的综合性基准,涵盖67个学科主题,包含大量中国特定知识题目。
    00
    AI模型评测# AI模型评测# CMMLU# GitHub
    OpenCompass – 上海AI实验室大模型开放评测体系与一站式评估平台

    OpenCompass – 上海AI实验室大模型开放评测体系与一站式评估平台

    OpenCompass是上海AI实验室开源的大模型一站式评测体系,提供评估工具包、基准社区和权威排行榜,推动模型评估标准化
    00
    AI模型评测# AI模型评测# CompassKit# 一站式评估
    AGI-Eval – 大模型评测社区与人类认知能力评估基准

    AGI-Eval – 大模型评测社区与人类认知能力评估基准

    AGI-Eval是由多所高校联合推出的大模型评测社区,专注于评估模型的人类认知与通用问题解决能力,提供权威榜单与开源评测生态。
    00
    AI模型评测# AGI# AI模型评测# DataWhale
    SuperCLUE – 中文大模型综合性测评基准与多维度能力评估

    SuperCLUE – 中文大模型综合性测评基准与多维度能力评估

    SuperCLUE是权威的中文通用大模型综合性测评基准,通过四大能力象限和12项基础能力对模型进行多维度评估与排名。
    00
    AI模型评测# AI智能体# AI模型评测# CLUE
    FlagEval(天秤) – 智源研究院大模型多维度评测平台与开放基准

    FlagEval(天秤) – 智源研究院大模型多维度评测平台与开放基准

    FlagEval(天秤)是智源研究院推出的大模型综合评测平台,采用“能力-任务-指标”三维框架,提供多模态自动化评测与权威排行榜。
    00
    AI模型评测# AI基准测试# AI模型评测# BAAI
    C-Eval – 中文大模型权威评测基准

    C-Eval – 中文大模型权威评测基准

    C-Eval是由上海交大、清华等高校联合推出的中文大模型标准化评估套件,通过涵盖52个学科的万余道选择题,为模型中文能力提供权威量化基准。
    00
    AI模型评测# AI模型评测# AI研究工具# Zero-shot
    Open LLM Leaderboard – Hugging Face大语言模型评测排行榜

    Open LLM Leaderboard – Hugging Face大语言模型评测排行榜

    Open LLM Leaderboard是Hugging Face平台上的大语言模型性能评测排行榜,为用户提供客观、全面的模型能力对比参考。
    00
    AI模型评测# AI工具导航# AI模型评测# AI评测基准
    MagicArena – 字节跳动推出的视觉生成模型对战评测平台

    MagicArena – 字节跳动推出的视觉生成模型对战评测平台

    MagicArena是字节跳动推出的视觉生成模型对战平台,通过用户投票对比Midjourney、FLUX等模型的图片视频生成效果,并生成动态排行榜。
    00
    AI图像工具AI模型评测# AI模型评测# AI绘画# FLUX
    ModelScope – AI模型社区

    ModelScope – AI模型社区

    ModelScope是阿里达摩院推出的AI模型开源社区,提供海量预训练模型、数据集和开发工具,支持一站式AI模型服务。
    00
    AI大模型AI开发平台# AI大模型# AI开发平台# AI模型评测
    没有了
    AI工具导航
    云记号导航(www.yjdh.com)是一个持续整理国内外 AI 工具与资源的 AI 工具导航站,收录 AI 网站、数据资源、书籍、APP 和实用文章。 内容覆盖 AI 写作、AI 绘画、AI 视频、AI 办公、AI 编程、AI 搜索、大模型、智能体和 API 等方向,按分类提供工具入口、功能信息、适用场景和相关内容,方便快速筛选与访问。 无论是创作者、职场人、开发者还是 AI 学习者,都可以在云记号导航发现适合当前需求的工具和资源。

    友链申请 免责声明 广告合作 关于我们

    扫码加QQ群AI工具导航
    扫码加QQ群
    扫码加微信AI工具导航
    扫码加微信
    Copyright © 2026 AI工具导航 渝ICP备2021001666号-4  渝公网安备50010602503992号 
    反馈
    让我们一起共建文明社区!您的反馈至关重要!
    网址
    网址文章