AI模型评测
实测对比各类 AI 模型,客观评测性能与效果
天壤智能 - 企业级AI决策智能平台,助力城市治理与商业智能化转型
116天壤智能是一家专注于AI决策智能的企业级平台,提供从数据采集、模型训练到智能决策的全链路解决方案。核心功能包括城市大脑、金融风控、智慧零售等场景的AI应用,支持实时数据分析、预测建模与自动化决策。适用于政府、金融、零售等行业,帮助企业实现智能化升级。
2026-07-15北京智源人工智能研究院 - 中国领先的人工智能研究机构,推动AI前沿技术研发与开源生态建设
114北京智源人工智能研究院(BAAI)是中国领先的人工智能研究机构,专注于AI前沿技术研发、开源生态建设和人才培养。核心功能包括:发布全球领先的AI大模型(如悟道系列)、构建开源平台(如FlagOpen)、举办AI学术会议(如智源大会)、推动AI伦理与安全研究。适用于科研人员、开发者、企业及政策制定者,提供从基础研究到产业落地的全方位支持。
2026-07-15AnythingLLM——全栈AI应用与私有知识库,用任何模型打造你的专属ChatGPT
131AnythingLLM是一款全栈AI应用,支持任何商业或开源LLM,内置RAG、AI代理和无代码代理构建器。可本地运行或远程托管,与文档智能对话,无需繁琐设置。支持MCP协议,提供Desktop与Docker部署,适合个人与企业构建私有、功能完整的AI助手。
2026-07-14Cherry Studio——全能AI工作站,统一接入300+主流大模型的桌面客户端
113Cherry Studio是一款跨平台的AI桌面客户端,集成OpenAI、Claude、Gemini等300+主流模型及Ollama本地模型。支持智能对话、自主Agent、文档处理、全局搜索等功能,数据本地存储,隐私安全。社区版完全免费开源,支持Windows、macOS和Linux。
2026-07-14H2O.ai——从开源机器学习先驱到"主权AI"守护者,用融合架构重新定义企业级智能体
143H2O.ai是领先的企业级AI平台,以融合预测性AI与生成式AI为核心,专注于私有、受保护数据的AI部署。旗舰产品h2oGPTe和H2O Super Agent支持在本地、VPC和空气隔离环境中构建安全的自主智能体。在GAIA和FutureX等权威基准测试中,其智能体准确性位居前列。被超过半数的《财富》500强及全球最严监管行业所信任。
2026-07-10PubMedQA——专为生物医学问答打造的“AI标尺”,能读懂科研论文才算真正通过“医学图灵测试”
135PubMedQA是首个要求对生物医学研究文本进行推理的问答数据集,由匹兹堡大学等机构于2019年发布。其任务基于PubMed摘要回答Yes/No/Maybe三类问题,包含1k专家标注数据与211k人工生成数据,旨在评估AI模型对复杂医学文献的理解与推理能力。被广泛用于衡量大语言模型在医学领域的实际水平。
2026-07-10SuperCLUE——中文大模型的“横评标尺”,从基础能力到Agent智能体,谁在裸泳一测便知
146SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队发布。它通过开放域多轮、封闭域客观题、匿名对战三大基准,以及数学推理、代码生成、Agent等维度,定期发布月度与半年度报告,为中文大模型提供权威、多维度的能力评估与排名。
2026-07-10AGI-Eval:上海交通大学等顶尖高校联合打造的大模型评测社区与权威第三方评测平台
228AGI-Eval是由上海交通大学、同济大学、华东师范大学及DataWhale等顶尖高校与机构联合打造的大模型评测社区,以“评测助力,让AI成为人类更好的伙伴”为使命。平台通过一系列高质量的人类认知考试(如LSAT、中国高考、SAT、数学竞赛、律师资格考试等)评估基础模型的通用能力,整合中英文双语任务,提供业内大语言模型的综合能力得分排名,涵盖综合评测及各专项能力评测。平台还提供Data Studio数据工坊,拥有超过3万众包用户,已上线485个任务标签,数据总量超过32万条,支持用户自建评测集、高校私有数据集托管,并已开源内部评测框架。
2026-05-31OpenCompass:上海人工智能实验室打造的开源大模型全方位评测体系与司南开放平台
231OpenCompass(司南)是由上海人工智能实验室推出的开源开放大模型评测体系,提供一站式大语言模型、多模态模型及科学智能模型评测服务。平台支持300+评测数据集、200+大语言模型、150+多模态模型的一键式分布式评测,涵盖知识、语言、推理、理解、数学、代码生成、智能体决策等八大能力维度,并扩展至科学智能、AI计算系统、具身智能、安全可信及垂类行业应用等六大领域,形成“六位一体”的全景评估范式。
2026-05-31FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台
277FlagEval(天秤)是由北京智源人工智能研究院发起的大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准与方法。平台创新构建了“能力-任务-指标”三维评测框架,覆盖自然语言处理、计算机视觉、音频及多模态四大场景,支持语言大模型评测、多语言文图大模型评测、文图生成评测等工具。目前已集成600+评测子维度、84,433道评测题目,并提供“天秤角斗场”模型对战功能,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对比评测。
2026-05-31MMLU:大语言模型多任务语言理解能力的国际权威评测基准
189MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校等机构联合发布的大规模多任务语言理解评测数据集,涵盖57个学科领域,包括人文科学、社会科学、自然科学、工程技术以及医学、法律、数学等专业领域,题目难度覆盖从初等知识到高阶专业知识。测试集包含约14,000道四选一选择题,用于评估大语言模型在零样本和少样本场景下的知识储备与推理能力,是目前全球引用率最高的大模型评测基准之一。
2026-05-31HELM:斯坦福大学领衔的大语言模型全面评估框架与高影响力行业标准
173HELM(Holistic Evaluation of Language Models)是由斯坦福大学基础模型研究中心CRFM发起的全面语言模型评估框架,旨在通过多维度、标准化、可复现的方式对大语言模型进行系统性评测。HELM覆盖核心场景(如问答、信息检索、摘要)与核心指标(如准确性、鲁棒性、公平性、偏见、毒性、效率),支持用户自定义评估管道,并提供公开可比的模型排行榜,累计评测模型数十款,被学术界和工业界广泛采纳为标准评估基准
2026-05-30CMMLU:权威中文大语言模型知识理解能力评测基准与67学科全覆盖测试集
208CMMLU(Chinese Massive Multitask Language Understanding)是一个专门针对中文语境设计的大规模多任务语言理解评测基准,涵盖从初等到高等专业级别的67个学科主题,包含自然科学、社会科学、工程技术、人文学科以及具有中国文化特色的内容(如中国驾驶规则等)。测试集包含11,582道四选一选择题,每道题均提供四个选项且仅有一个正确答案,用于评估大语言模型在中文语境下的知识掌握程度和推理能力。
2026-05-30