"Eva" 的搜索结果
共找到13个结果(工具7个· 资讯5篇· 技能1个),SeoAIu已按相关性为你排序。
AI工具 (7)
FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台
276FlagEval(天秤)是由北京智源人工智能研究院发起的大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准与方法。平台创新构建了“能力-任务-指标”三维评测框架,覆盖自然语言处理、计算机视觉、音频及多模态四大场景,支持语言大模型评测、多语言文图大模型评测、文图生成评测等工具。目前已集成600+评测子维度、84,433道评测题目,并提供“天秤角斗场”模型对战功能,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对比评测。
2026-05-31OpenCompass:上海人工智能实验室打造的开源大模型全方位评测体系与司南开放平台
231OpenCompass(司南)是由上海人工智能实验室推出的开源开放大模型评测体系,提供一站式大语言模型、多模态模型及科学智能模型评测服务。平台支持300+评测数据集、200+大语言模型、150+多模态模型的一键式分布式评测,涵盖知识、语言、推理、理解、数学、代码生成、智能体决策等八大能力维度,并扩展至科学智能、AI计算系统、具身智能、安全可信及垂类行业应用等六大领域,形成“六位一体”的全景评估范式。
2026-05-31AGI-Eval:上海交通大学等顶尖高校联合打造的大模型评测社区与权威第三方评测平台
227AGI-Eval是由上海交通大学、同济大学、华东师范大学及DataWhale等顶尖高校与机构联合打造的大模型评测社区,以“评测助力,让AI成为人类更好的伙伴”为使命。平台通过一系列高质量的人类认知考试(如LSAT、中国高考、SAT、数学竞赛、律师资格考试等)评估基础模型的通用能力,整合中英文双语任务,提供业内大语言模型的综合能力得分排名,涵盖综合评测及各专项能力评测。平台还提供Data Studio数据工坊,拥有超过3万众包用户,已上线485个任务标签,数据总量超过32万条,支持用户自建评测集、高校私有数据集托管,并已开源内部评测框架。
2026-05-31HELM:斯坦福大学领衔的大语言模型全面评估框架与高影响力行业标准
173HELM(Holistic Evaluation of Language Models)是由斯坦福大学基础模型研究中心CRFM发起的全面语言模型评估框架,旨在通过多维度、标准化、可复现的方式对大语言模型进行系统性评测。HELM覆盖核心场景(如问答、信息检索、摘要)与核心指标(如准确性、鲁棒性、公平性、偏见、毒性、效率),支持用户自定义评估管道,并提供公开可比的模型排行榜,累计评测模型数十款,被学术界和工业界广泛采纳为标准评估基准
2026-05-30SuperCLUE——中文大模型的“横评标尺”,从基础能力到Agent智能体,谁在裸泳一测便知
145SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队发布。它通过开放域多轮、封闭域客观题、匿名对战三大基准,以及数学推理、代码生成、Agent等维度,定期发布月度与半年度报告,为中文大模型提供权威、多维度的能力评估与排名。
2026-07-10Eva Design System——基于深度学习的智能配色生成器
103Eva Design System是一款利用深度学习技术的配色生成工具。用户只需选择一个品牌色,系统即可自动生成包含10种渐变色阶的完整调色板,并基于色彩理论扩展出语义明确的辅助色板。适合设计师快速搭建产品UI色彩体系,确保色彩搭配的科学性与一致性。
2026-07-10ThinkAny——基于RAG的AI搜索引擎,一个周末诞生的信息获取新方式
85ThinkAny是一款基于RAG(检索增强生成)技术的AI搜索引擎,通过聚合网络优质内容并结合AI智能问答,提供直接、精准的答案而非链接列表。它支持多模态搜索、思维导图式摘要,并衍生出桌面AI Agent WorkAny。由开发者用一个周末打造,上线三个月即获17万用户。
2026-07-14AI资讯 (5)
通义评测深度解析:技术架构、能力评测与适用场景全方面对比分析
39通义评测深度解析:技术架构、能力评测与适用场景全方面对比分析 各位老铁,最近AI圈又炸锅了!不是因为GPT-5又憋了什么大招,而是咱们国产的通义系列模型,在「通义评测」中交出了一份让人相当意外的成绩单。作为一个每天跟各种大模型打交道的重度用户,我用了整整一周时间,把通义千问的最新版本从头到尾、从里到外翻了个底朝天。今天这篇「通义评测」深度解析,不吹不黑,带大家看看这个被很多人忽视的国产选手,到底...
文心一言评测深度解析:技术架构、能力评测与适用场景全方面对比分析
36文心一言评测深度解析:技术架构、能力评测与适用场景全方面对比分析 最近后台收到好多小伙伴私信,问我到底该怎么选大语言模型,特别是对百度的文心一言,大家是又好奇又纠结。毕竟市面上ChatGPT、Claude这些海外选手热度不减,而国产之光文心一言也一直在迭代。作为一个天天泡在各种AI工具里的老油条,我今天就打算掏心窝子,给大家做一次超详细的文心一言评测,从技术底子到实际体验,咱们一次聊透。 说实...
LLM评测深度解析:技术架构、能力评测与适用场景全方面对比分析
32LLM评测深度解析:技术架构、能力评测与适用场景全方面对比分析 兄弟姐妹们,最近这大模型圈儿可是热闹得不行,各种新模型跟下饺子似的往外蹦。今天咱们不聊八卦,来点硬核的——LLM评测。说实话,我每天打开后台,私信里问得最多的就是“哪个模型最牛?”、“我该用哪个?”…… 每次看到这种问题,我都想扶额叹气。因为LLM评测这事儿,真不是看个跑分就能拍板的,它背后涉及到的技术架构、训练数据、对齐策略,那门...
AI接单平台进阶技巧大公开:高手都在用的10个方法,让你的AI技能更上一层楼
29AI接单平台进阶技巧大公开:高手都在用的10个方法,让你的AI技能更上一层楼 兄弟们,姐妹们,最近是不是感觉AI这股风刮得越来越猛了?打开朋友圈,不是晒AI生成的精美海报,就是炫耀又用AI工具接了个大单。说实话,看着别人在AI接单平台上赚得盆满钵满,自己却还在原地踏步,心里那叫一个痒啊!🤔 别急,今天我就把压箱底的干货全掏出来,跟大伙儿聊聊在AI接单平台上那些高手们秘而不宣的进阶玩法。这可不是...
一文读懂LLM评测:核心技术原理与优势分析,附5个实际应用场景演示
8引言:当AI开始“考试”,我们该如何阅卷? 兄弟们,姐妹们,最近圈子里最卷的是什么?不是新出的AI工具,也不是哪个大模型又刷榜了,而是LLM评测!说真的,我最近每天都在刷各种榜单,看着那些分数上蹿下跳,比看股票还刺激。但你有没有想过,那些亮眼的99分、88分,到底是咋评出来的?是机器阅卷还是人工打分?这背后有啥猫腻? 今天咱不整虚的,直接把「LLM评测」这层窗户纸捅破。从技术原理到实际应用,从优势...