"LLM" 的搜索结果
共找到26个结果(工具23个· 资讯2篇· 技能1个),SeoAIu已按相关性为你排序。
AI工具 (23)
FlagEval:智源研究院打造的国际权威大模型评测体系与天秤开放平台
206FlagEval(天秤)是由北京智源人工智能研究院发起的大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准与方法。平台创新构建了“能力-任务-指标”三维评测框架,覆盖自然语言处理、计算机视觉、音频及多模态四大场景,支持语言大模型评测、多语言文图大模型评测、文图生成评测等工具。目前已集成600+评测子维度、84,433道评测题目,并提供“天秤角斗场”模型对战功能,支持纯文本、图文理解、文生图、文生视频四种模态的匿名对比评测。
2026-05-31AGI-Eval:上海交通大学等顶尖高校联合打造的大模型评测社区与权威第三方评测平台
161AGI-Eval是由上海交通大学、同济大学、华东师范大学及DataWhale等顶尖高校与机构联合打造的大模型评测社区,以“评测助力,让AI成为人类更好的伙伴”为使命。平台通过一系列高质量的人类认知考试(如LSAT、中国高考、SAT、数学竞赛、律师资格考试等)评估基础模型的通用能力,整合中英文双语任务,提供业内大语言模型的综合能力得分排名,涵盖综合评测及各专项能力评测。平台还提供Data Studio数据工坊,拥有超过3万众包用户,已上线485个任务标签,数据总量超过32万条,支持用户自建评测集、高校私有数据集托管,并已开源内部评测框架。
2026-05-31OpenCompass:上海人工智能实验室打造的开源大模型全方位评测体系与司南开放平台
155OpenCompass(司南)是由上海人工智能实验室推出的开源开放大模型评测体系,提供一站式大语言模型、多模态模型及科学智能模型评测服务。平台支持300+评测数据集、200+大语言模型、150+多模态模型的一键式分布式评测,涵盖知识、语言、推理、理解、数学、代码生成、智能体决策等八大能力维度,并扩展至科学智能、AI计算系统、具身智能、安全可信及垂类行业应用等六大领域,形成“六位一体”的全景评估范式。
2026-05-31CMMLU:权威中文大语言模型知识理解能力评测基准与67学科全覆盖测试集
148CMMLU(Chinese Massive Multitask Language Understanding)是一个专门针对中文语境设计的大规模多任务语言理解评测基准,涵盖从初等到高等专业级别的67个学科主题,包含自然科学、社会科学、工程技术、人文学科以及具有中国文化特色的内容(如中国驾驶规则等)。测试集包含11,582道四选一选择题,每道题均提供四个选项且仅有一个正确答案,用于评估大语言模型在中文语境下的知识掌握程度和推理能力。
2026-05-30MMLU:大语言模型多任务语言理解能力的国际权威评测基准
126MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校等机构联合发布的大规模多任务语言理解评测数据集,涵盖57个学科领域,包括人文科学、社会科学、自然科学、工程技术以及医学、法律、数学等专业领域,题目难度覆盖从初等知识到高阶专业知识。测试集包含约14,000道四选一选择题,用于评估大语言模型在零样本和少样本场景下的知识储备与推理能力,是目前全球引用率最高的大模型评测基准之一。
2026-05-31PromptPilot:从“提问小白”变身AI指令工程师的专业提示词优化与自动化调优平台
125PromptPilot是一款由火山引擎推出的系统性提示词工程平台,旨在解决“如何向AI高效提问”的痛点。它提供覆盖Prompt生成、调试、评估与迭代的全生命周期管理,支持自然语言一键改写指令、多模型对比测试、多模态与工具调用优化,并能通过闭环迭代机制将“不良案例”(Bad Case)转化为模型优化数据,帮助开发者和普通用户降低提示词撰写门槛,实现AI输出的高质量与稳定性。
2026-05-30HELM:斯坦福大学领衔的大语言模型全面评估框架与高影响力行业标准
121HELM(Holistic Evaluation of Language Models)是由斯坦福大学基础模型研究中心CRFM发起的全面语言模型评估框架,旨在通过多维度、标准化、可复现的方式对大语言模型进行系统性评测。HELM覆盖核心场景(如问答、信息检索、摘要)与核心指标(如准确性、鲁棒性、公平性、偏见、毒性、效率),支持用户自定义评估管道,并提供公开可比的模型排行榜,累计评测模型数十款,被学术界和工业界广泛采纳为标准评估基准
2026-05-30LangGPT——结构化提示词设计框架:面向大语言模型的自然语言编程
117LangGPT是一个受编程语言启发而设计的结构化提示词设计框架,旨在解决非AI专家难以编写高质量提示词的问题。借鉴面向对象编程语言的设计思想,LangGPT提出了“模块+元素”的双层结构,将提示词像代码一样进行结构化组织
2026-05-29文心大模型:百度十年磨一剑的产业级知识增强大模型
112文心大模型(ERNIE)是百度自主研发的产业级知识增强大模型,从2019年发布1.0版本起步,历经多代技术迭代,已构建起基础大模型、任务大模型、行业大模型三级体系。2025年11月发布的文心5.0实现原生全模态统一建模,参数量达2.4万亿,支持文本、图像、音频、视频的全模态理解与生成。2026年5月发布的文心5.1在搜索能力上位列国内第一、全球第四,预训练成本仅为业界6%。平台通过千帆大模型平台为开发者提供模型训练、部署、监控的全生命周期管理,已汇聚超过19万款标准化组件,服务8.5万家企业客户。
2026-06-03SuperCLUE——中文大模型的“横评标尺”,从基础能力到Agent智能体,谁在裸泳一测便知
96SuperCLUE是中文通用大模型综合性测评基准,由CLUE团队发布。它通过开放域多轮、封闭域客观题、匿名对战三大基准,以及数学推理、代码生成、Agent等维度,定期发布月度与半年度报告,为中文大模型提供权威、多维度的能力评估与排名。
2026-07-10StableLM——Stable Diffusion同门开源的AI大模型,3B参数就能跑、还可商用
96StableLM是Stability AI推出的开源大语言模型系列,基于The Pile扩展数据集训练,数据规模达1.5万亿token。提供1.6B、3B、7B、12B等多个参数版本,支持文本生成与代码编写。采用CC BY-SA 4.0开源协议,允许免费商用。Stable LM 2 12B在部分基准测试中表现超越Llama 2 70B。适合开发者、研究者及中小企业私有化部署。
2026-07-02Sapling AI Content Detector——来自前谷歌研究员的"照妖镜",能否看穿GPT-5和Claude 4.5的把戏?
93Sapling AI内容检测器由前谷歌研究员开发,是一款用于识别文本是否由AI生成的检测工具。它声称对AI生成内容的检测率超过97%,对人类文本的误报率低于3%。支持GPT-5、Claude 4.5、Gemini 2.5等最新模型,可处理PDF和DOCX文件,并提供浏览器扩展,方便在网页上随时检测。
2026-07-09PubMedQA——专为生物医学问答打造的“AI标尺”,能读懂科研论文才算真正通过“医学图灵测试”
84PubMedQA是首个要求对生物医学研究文本进行推理的问答数据集,由匹兹堡大学等机构于2019年发布。其任务基于PubMed摘要回答Yes/No/Maybe三类问题,包含1k专家标注数据与211k人工生成数据,旨在评估AI模型对复杂医学文献的理解与推理能力。被广泛用于衡量大语言模型在医学领域的实际水平。
2026-07-10深度智联,易居中国旗下房地产垂直领域AI原生平台
77深度智联是易居中国旗下专注于不动产垂直领域的AI原生应用与数字员工平台,成立于2025年。公司依托易居中国30年房地产实践经验和克而瑞20年数据积累,打造了覆盖土地、开发、交易、运营全链条的房地产行业专属AI解决方案。2026年5月27日,深度智联在上海举办AI+不动产生态大会,正式发布房地产行业大模型DeepLink RE-LLM,并推出三大核心产品:企业级AI原生工作平台CoWork、泛地产认知优化解决方案“极客问道”、全球首个房地产经纪人智能体“易居·小新”。目前公司拥有150+“行业专家+AI专家”的复合型团队,已通过网信办算法备案,并入选2025上海市“模塑申城”住建行业人工智能创新应用十佳场景。
2026-05-28AnythingLLM——全栈AI应用与私有知识库,用任何模型打造你的专属ChatGPT
70AnythingLLM是一款全栈AI应用,支持任何商业或开源LLM,内置RAG、AI代理和无代码代理构建器。可本地运行或远程托管,与文档智能对话,无需繁琐设置。支持MCP协议,提供Desktop与Docker部署,适合个人与企业构建私有、功能完整的AI助手。
2026-07-14秘塔AI搜索——会思考、带参考文献的免费AI搜索引擎,做研究再也不用翻几百页资料
63秘塔AI搜索是上海秘塔网络科技基于自研大模型MetaLLM推出的智能搜索引擎。它提供简洁、深入、研究三种搜索模式,支持全网、文库、学术、播客等多范围搜索,搜索结果自动生成大纲和思维导图,每一条都附带参考文献来源。内置DeepSeek R1深度思考模型,支持“先想后搜”的研究模式。网页、APP、小程序三端通用,免费版每日100次搜索额度。适合学生、科研人员、职场人,让信息检索从“给链接”变成“直接给答案”
2026-07-02魔搭社区(ModelScope)——中国最大、最活跃的AI开源模型平台,超3000万开发者的“模型即服务”生态
45魔搭社区(ModelScope)是由阿里巴巴达摩院联合CCF开源发展委员会发起的国内领先AI模型开源平台。秉持“模型即服务”(MaaS)理念,社区已汇聚超20万个开源模型、3000万开发者及超500家贡献机构。提供从模型体验、下载、微调、训练到部署的全链路服务,覆盖LLM、多模态、语音、AIGC等领域。作为中国AI开发者的核心基础设施,它正通过“开源开放”推动AI技术的普惠化
2026-07-14Jan - 开源离线AI助手工具,支持本地运行大语言模型,保护用户隐私
35Jan是一款免费开源的AI助手工具,专注于在用户本地设备上运行大语言模型,无需联网即可使用。它支持多种主流模型(如Llama、Mistral等),提供简洁直观的界面,帮助用户轻松加载和管理模型。Jan强调隐私保护,所有数据完全本地处理,适合对数据安全敏感的用户。无论是个人学习、写作辅助还是轻量级开发任务,Jan都能提供高效、私密的AI体验。
2026-07-15Cohere - 企业级AI大模型平台,助力构建检索增强生成(RAG)与智能搜索应用
35Cohere是一个专注于企业级应用的AI大模型平台,提供强大的自然语言处理(NLP)模型,包括文本生成、语义搜索、分类和检索增强生成(RAG)等功能。其核心优势在于支持私有化部署、数据安全可控,并针对企业场景优化了模型的准确性和效率。广泛应用于智能客服、知识库检索、文档分析、内容生成等场景,帮助企业快速构建基于LLM的智能应用。
2026-07-15Google PaLM 2——下一代多语言、强推理与代码能力的AI大语言模型
31PaLM 2是Google于2023年I/O大会推出的下一代大语言模型。它具备更强的多语言能力(覆盖100+种语言)、逻辑推理与数学能力以及代码生成能力,提供从移动端可运行的Gecko到高性能的Unicorn四种规格。PaLM 2已赋能Bard、Google Workspace、Med-PaLM 2、Sec-PaLM等超过25款Google产品,是推动Google AI战略的核心模型
2026-07-14FormX.ai AI文档数据提取自动化工具
20FormX.ai 是一款基于AI的文档数据提取工具,能够自动从发票、收据、银行对账单、合同、申请表等多种文档中提取结构化数据。只需三步:创建提取器、上传样本、连接API,即可快速集成到现有工作流中。支持视觉与LLM模型切换,持续优化精度,并提供生产级数据保护,大幅减少人工录入错误,提升业务效率。
2026-07-20DeepSeek深度求索AI对话与API平台,探索AGI前沿的通用大模型
17DeepSeek(深度求索)成立于2023年,专注于研究世界领先的通用人工智能底层模型与技术。平台提供免费AI对话、API开放接口调用,已发布并开源多个百亿级参数大模型,包括DeepSeek-LLM通用大语言模型、DeepSeek-Coder代码大模型、DeepSeek-MoE混合专家模型等。最新DeepSeek-V4版本具备世界顶级推理性能,Agent能力大幅提升,可在网页端、APP和API使用,助力开发者快速集成与流畅体验。
2026-07-22ZenMux - AI多模型混合推理平台
13ZenMux是一个创新的AI多模型混合推理平台,旨在通过智能路由和模型组合优化AI推理效率。平台支持同时调用多个大语言模型(LLM),自动选择最优模型或组合方案,以平衡成本、速度和准确性。适用于开发者、AI研究者和企业用户,帮助他们降低API调用成本、提升响应速度,并实现更复杂的推理任务。ZenMux提供灵活的API接口和可视化仪表盘,支持实时监控和模型切换。
2026-07-23