"开源评测工具" 的搜索结果

共找到3个结果(工具3个· 资讯0篇· 技能0个),SeoAIu已按相关性为你排序。

AI工具 (3)

FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台

312
FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台
AI Tools

FlagEval(天秤)是由北京智源人工智能研究院发起的大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准与方法。平台创新构建了“能力-任务-指标”三维评测框架,覆盖自然语言处理、计算机视觉、音频及多模态四大场景,支持语言大模型评测、多语言文图大模型评测、文图生成评测等工具。目前已集成600+评测子维度、84,433道评测题目,并提供“天秤角斗场”模型对战功能,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对比评测。

2026-05-31

OpenCompass:上海人工智能实验室打造的开源大模型全方位评测体系与司南开放平台

275
OpenCompass:上海人工智能实验室打造的开源大模型全方位评测体系与司南开放平台
AI Tools

OpenCompass(司南)是由上海人工智能实验室推出的开源开放大模型评测体系,提供一站式大语言模型、多模态模型及科学智能模型评测服务。平台支持300+评测数据集、200+大语言模型、150+多模态模型的一键式分布式评测,涵盖知识、语言、推理、理解、数学、代码生成、智能体决策等八大能力维度,并扩展至科学智能、AI计算系统、具身智能、安全可信及垂类行业应用等六大领域,形成“六位一体”的全景评估范式。

2026-05-31

HELM:斯坦福大学领衔的大语言模型全面评估框架与高影响力行业标准

202
HELM:斯坦福大学领衔的大语言模型全面评估框架与高影响力行业标准
AI Tools

HELM(Holistic Evaluation of Language Models)是由斯坦福大学基础模型研究中心CRFM发起的全面语言模型评估框架,旨在通过多维度、标准化、可复现的方式对大语言模型进行系统性评测。HELM覆盖核心场景(如问答、信息检索、摘要)与核心指标(如准确性、鲁棒性、公平性、偏见、毒性、效率),支持用户自定义评估管道,并提供公开可比的模型排行榜,累计评测模型数十款,被学术界和工业界广泛采纳为标准评估基准

2026-05-30