"benchmark" 的搜索结果

共找到7个结果(工具5个· 资讯2篇· 技能0个),SeoAIu已按相关性为你排序。

AI工具 (5)

FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台

248
FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台
AI Tools

FlagEval(天秤)是由北京智源人工智能研究院发起的大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准与方法。平台创新构建了“能力-任务-指标”三维评测框架,覆盖自然语言处理、计算机视觉、音频及多模态四大场景,支持语言大模型评测、多语言文图大模型评测、文图生成评测等工具。目前已集成600+评测子维度、84,433道评测题目,并提供“天秤角斗场”模型对战功能,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对比评测。

2026-05-31

CMMLU:权威中文大语言模型知识理解能力评测基准与67学科全覆盖测试集

190
CMMLU:权威中文大语言模型知识理解能力评测基准与67学科全覆盖测试集
AI Tools

CMMLU(Chinese Massive Multitask Language Understanding)是一个专门针对中文语境设计的大规模多任务语言理解评测基准,涵盖从初等到高等专业级别的67个学科主题,包含自然科学、社会科学、工程技术、人文学科以及具有中国文化特色的内容(如中国驾驶规则等)。测试集包含11,582道四选一选择题,每道题均提供四个选项且仅有一个正确答案,用于评估大语言模型在中文语境下的知识掌握程度和推理能力。

2026-05-30

MMLU:大语言模型多任务语言理解能力的国际权威评测基准

167
MMLU:大语言模型多任务语言理解能力的国际权威评测基准
AI Tools

MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校等机构联合发布的大规模多任务语言理解评测数据集,涵盖57个学科领域,包括人文科学、社会科学、自然科学、工程技术以及医学、法律、数学等专业领域,题目难度覆盖从初等知识到高阶专业知识。测试集包含约14,000道四选一选择题,用于评估大语言模型在零样本和少样本场景下的知识储备与推理能力,是目前全球引用率最高的大模型评测基准之一。

2026-05-31

SuperCLUE——中文大模型的“横评标尺”,从基础能力到Agent智能体,谁在裸泳一测便知

125
SuperCLUE——中文大模型的“横评标尺”,从基础能力到Agent智能体,谁在裸泳一测便知
AI Tools

SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队发布。它通过开放域多轮、封闭域客观题、匿名对战三大基准,以及数学推理、代码生成、Agent等维度,定期发布月度与半年度报告,为中文大模型提供权威、多维度的能力评估与排名。

2026-07-10

PubMedQA——专为生物医学问答打造的“AI标尺”,能读懂科研论文才算真正通过“医学图灵测试”

113
PubMedQA——专为生物医学问答打造的“AI标尺”,能读懂科研论文才算真正通过“医学图灵测试”
AI Tools

PubMedQA是首个要求对生物医学研究文本进行推理的问答数据集,由匹兹堡大学等机构于2019年发布。其任务基于PubMed摘要回答Yes/No/Maybe三类问题,包含1k专家标注数据与211k人工生成数据,旨在评估AI模型对复杂医学文献的理解与推理能力。被广泛用于衡量大语言模型在医学领域的实际水平。

2026-07-10

AI资讯 (2)