HELM – 斯坦福大学语言模型整体评估基准与全面评测体系 HELM是斯坦福大学推出的语言模型整体评估基准,通过场景、适配、指标三大模块,系统评估模型在准确率、公平性、毒性等多维度的综合表现。 00 AI模型评测# AI模型评测# GitHub# HELM