"benchmark" 的搜索结果
共找到7个结果(工具5个· 资讯2篇· 技能0个),SeoAIu已按相关性为你排序。
AI工具 (5)
FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台
248FlagEval(天秤)是由北京智源人工智能研究院发起的大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准与方法。平台创新构建了“能力-任务-指标”三维评测框架,覆盖自然语言处理、计算机视觉、音频及多模态四大场景,支持语言大模型评测、多语言文图大模型评测、文图生成评测等工具。目前已集成600+评测子维度、84,433道评测题目,并提供“天秤角斗场”模型对战功能,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对比评测。
2026-05-31CMMLU:权威中文大语言模型知识理解能力评测基准与67学科全覆盖测试集
190CMMLU(Chinese Massive Multitask Language Understanding)是一个专门针对中文语境设计的大规模多任务语言理解评测基准,涵盖从初等到高等专业级别的67个学科主题,包含自然科学、社会科学、工程技术、人文学科以及具有中国文化特色的内容(如中国驾驶规则等)。测试集包含11,582道四选一选择题,每道题均提供四个选项且仅有一个正确答案,用于评估大语言模型在中文语境下的知识掌握程度和推理能力。
2026-05-30MMLU:大语言模型多任务语言理解能力的国际权威评测基准
167MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校等机构联合发布的大规模多任务语言理解评测数据集,涵盖57个学科领域,包括人文科学、社会科学、自然科学、工程技术以及医学、法律、数学等专业领域,题目难度覆盖从初等知识到高阶专业知识。测试集包含约14,000道四选一选择题,用于评估大语言模型在零样本和少样本场景下的知识储备与推理能力,是目前全球引用率最高的大模型评测基准之一。
2026-05-31SuperCLUE——中文大模型的“横评标尺”,从基础能力到Agent智能体,谁在裸泳一测便知
125SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队发布。它通过开放域多轮、封闭域客观题、匿名对战三大基准,以及数学推理、代码生成、Agent等维度,定期发布月度与半年度报告,为中文大模型提供权威、多维度的能力评估与排名。
2026-07-10PubMedQA——专为生物医学问答打造的“AI标尺”,能读懂科研论文才算真正通过“医学图灵测试”
113PubMedQA是首个要求对生物医学研究文本进行推理的问答数据集,由匹兹堡大学等机构于2019年发布。其任务基于PubMed摘要回答Yes/No/Maybe三类问题,包含1k专家标注数据与211k人工生成数据,旨在评估AI模型对复杂医学文献的理解与推理能力。被广泛用于衡量大语言模型在医学领域的实际水平。
2026-07-10AI资讯 (2)
2025最好用的AI工具实测报告:2026年最新跑分、使用体验与横向对比,数据说话
72025最好用的AI工具实测报告:2026年最新跑分、使用体验与横向对比,数据说话 兄弟们,姐妹们,打工人和自由职业者们,先别划走!我知道你们心里在想什么——“2025最好用的AI工具”这个话题都快被写烂了,满屏都是恰饭软文和复制粘贴的测评,谁信啊? 但今天这篇不一样。我不整虚的,不搞“十大榜单”那种水货。我花了整整三周时间,把市面上最火的十几款AI大模型和工具翻来覆去地“折磨”了一遍,从代码...
最新LLM benchmarkvs竞品横评:谁才是2026年最强的AI大模型?附详细跑分
4引言:2026年,AI大模型战场的“华山论剑” 兄弟们,姐妹们,2026年开年不到三个月,AI圈又炸锅了!各家大厂和创业公司像下饺子一样往外甩新模型,参数一个比一个夸张,宣传语一个比一个玄乎。什么“AGI曙光”、“人类救星”、“打工人福音”,看得人眼花缭乱。 但咱们搞技术的都知道,吹牛谁都会,跑分见真章。在铺天盖地的营销话术面前,只有硬核的LLM benchmark数据才是衡量一个模型真实实力的“...