C-Eval 是面向中文基础模型的综合性评测基准,覆盖多领域知识与能力评估。...
SuperCLUE 是中文通用大模型综合性测评基准,全面评估大模型在多任务场景下的性能表现。...
OpenCompass 是上海人工智能实验室推出的开源大模型评测体系,支持多维度、标准化模型评估。...
CMMLU 是面向中文大模型的综合性评估基准,涵盖多领域知识与能力评测。...
MMBench 是面向多模态大模型的综合性评测体系,涵盖视觉、语言与跨模态理解能力。...
斯坦福大学推出的开源大模型评测体系,聚焦多维度、可复现的AI模型评估。...
LMArena 是一个专注于AI模型多维度评测的公开平台,支持用户对比测试主流大模型性能。...