"大语言模型" 的搜索结果
共找到37个结果(工具29个· 资讯4篇· 技能4个),SeoAIu已按相关性为你排序。
AI工具 (29)
OpenCompass:上海人工智能实验室打造的开源大模型全方位评测体系与司南开放平台
259OpenCompass(司南)是由上海人工智能实验室推出的开源开放大模型评测体系,提供一站式大语言模型、多模态模型及科学智能模型评测服务。平台支持300+评测数据集、200+大语言模型、150+多模态模型的一键式分布式评测,涵盖知识、语言、推理、理解、数学、代码生成、智能体决策等八大能力维度,并扩展至科学智能、AI计算系统、具身智能、安全可信及垂类行业应用等六大领域,形成“六位一体”的全景评估范式。
2026-05-31AGI-Eval:上海交通大学等顶尖高校联合打造的大模型评测社区与权威第三方评测平台
254AGI-Eval是由上海交通大学、同济大学、华东师范大学及DataWhale等顶尖高校与机构联合打造的大模型评测社区,以“评测助力,让AI成为人类更好的伙伴”为使命。平台通过一系列高质量的人类认知考试(如LSAT、中国高考、SAT、数学竞赛、律师资格考试等)评估基础模型的通用能力,整合中英文双语任务,提供业内大语言模型的综合能力得分排名,涵盖综合评测及各专项能力评测。平台还提供Data Studio数据工坊,拥有超过3万众包用户,已上线485个任务标签,数据总量超过32万条,支持用户自建评测集、高校私有数据集托管,并已开源内部评测框架。
2026-05-31CMMLU:权威中文大语言模型知识理解能力评测基准与67学科全覆盖测试集
224CMMLU(Chinese Massive Multitask Language Understanding)是一个专门针对中文语境设计的大规模多任务语言理解评测基准,涵盖从初等到高等专业级别的67个学科主题,包含自然科学、社会科学、工程技术、人文学科以及具有中国文化特色的内容(如中国驾驶规则等)。测试集包含11,582道四选一选择题,每道题均提供四个选项且仅有一个正确答案,用于评估大语言模型在中文语境下的知识掌握程度和推理能力。
2026-05-30MMLU:大语言模型多任务语言理解能力的国际权威评测基准
208MMLU(Massive Multitask Language Understanding)是由加州大学伯克利分校等机构联合发布的大规模多任务语言理解评测数据集,涵盖57个学科领域,包括人文科学、社会科学、自然科学、工程技术以及医学、法律、数学等专业领域,题目难度覆盖从初等知识到高阶专业知识。测试集包含约14,000道四选一选择题,用于评估大语言模型在零样本和少样本场景下的知识储备与推理能力,是目前全球引用率最高的大模型评测基准之一。
2026-05-31LangGPT——结构化提示词设计框架:面向大语言模型的自然语言编程
201LangGPT是一个受编程语言启发而设计的结构化提示词设计框架,旨在解决非AI专家难以编写高质量提示词的问题。借鉴面向对象编程语言的设计思想,LangGPT提出了“模块+元素”的双层结构,将提示词像代码一样进行结构化组织
2026-05-29HELM:斯坦福大学领衔的大语言模型全面评估框架与高影响力行业标准
191HELM(Holistic Evaluation of Language Models)是由斯坦福大学基础模型研究中心CRFM发起的全面语言模型评估框架,旨在通过多维度、标准化、可复现的方式对大语言模型进行系统性评测。HELM覆盖核心场景(如问答、信息检索、摘要)与核心指标(如准确性、鲁棒性、公平性、偏见、毒性、效率),支持用户自定义评估管道,并提供公开可比的模型排行榜,累计评测模型数十款,被学术界和工业界广泛采纳为标准评估基准
2026-05-30StableLM——Stable Diffusion同门开源的AI大模型,3B参数就能跑、还可商用
169StableLM是Stability AI推出的开源大语言模型系列,基于The Pile扩展数据集训练,数据规模达1.5万亿token。提供1.6B、3B、7B、12B等多个参数版本,支持文本生成与代码编写。采用CC BY-SA 4.0开源协议,允许免费商用。Stable LM 2 12B在部分基准测试中表现超越Llama 2 70B。适合开发者、研究者及中小企业私有化部署。
2026-07-02百小医 - 百川智能医疗AI助手,在线问诊与健康咨询
163百小医是百川智能推出的医疗健康AI助手,基于大语言模型技术,为用户提供在线问诊、症状分析、用药建议、健康知识查询等智能服务。它能够模拟医生问诊流程,结合医学知识库,给出专业、贴心的健康指导,帮助用户初步了解病情并获取就医建议。百小医致力于让每个人都能随时获得可靠的医疗信息支持,减轻医疗资源压力,提升健康管理效率。
2026-07-22LLaMA——Meta开源的AI模型革命,性能比肩GPT-4还完全免费可商用
157LLaMA是Meta推出的开源大语言模型家族,从2023年2月的LLaMA 1发展到多模态LLaMA 4。支持70B参数版本性能接近GPT-4,405B版本比肩GPT-4o,完全开源可商用。企业可免费下载部署在自有服务器,数据不外传,满足金融、医疗等行业的合规需求。全球下载量突破12亿次,适合需要私有化部署和深度定制的开发者和企业。
2026-07-02PubMedQA——专为生物医学问答打造的“AI标尺”,能读懂科研论文才算真正通过“医学图灵测试”
154PubMedQA是首个要求对生物医学研究文本进行推理的问答数据集,由匹兹堡大学等机构于2019年发布。其任务基于PubMed摘要回答Yes/No/Maybe三类问题,包含1k专家标注数据与211k人工生成数据,旨在评估AI模型对复杂医学文献的理解与推理能力。被广泛用于衡量大语言模型在医学领域的实际水平。
2026-07-10Replicate——用一行代码运行开源AI模型的云平台,数千模型即开即用
125Replicate是一个云平台,让开发者通过简单的API即可运行、微调并部署开源AI模型。它提供数千个社区贡献的模型,涵盖图像生成、大语言模型、音频视频处理等领域,无需管理基础设施,按实际使用的算力计费。新用户可获赠$25免费额度。
2026-07-14Google DeepMind Gemma——轻量、开源、可商用的新一代AI模型家族
115Gemma是Google DeepMind基于Gemini技术打造的开源AI模型家族。它提供从2B到31B等多种参数规模,支持文本、图像、音频等多模态理解与140+种语言,采用Apache 2.0协议可免费商用。Gemma以其轻量级、高性能著称,能在消费级硬件上本地运行,累计下载量已超4亿次,是开发者构建AI应用的主流选择之一。
2026-07-14Globe Explorer——把搜索结果变成知识图谱的AI探索引擎,像维基百科一样组织你的每一次搜索
110Globe Explorer是一款AI驱动的知识探索引擎,将用户查询转化为结构化的可视化主题页面。它利用大语言模型组织信息层级,生成类似维基百科的知识图谱和思维导图。支持多语言搜索、动态目录生成和协作注解,适合学术研究、市场分析和深度内容创作。提供免费版及付费Pro版,月活超22万。
2026-07-14Jan - 开源离线AI助手工具,支持本地运行大语言模型,保护用户隐私
108Jan是一款免费开源的AI助手工具,专注于在用户本地设备上运行大语言模型,无需联网即可使用。它支持多种主流模型(如Llama、Mistral等),提供简洁直观的界面,帮助用户轻松加载和管理模型。Jan强调隐私保护,所有数据完全本地处理,适合对数据安全敏感的用户。无论是个人学习、写作辅助还是轻量级开发任务,Jan都能提供高效、私密的AI体验。
2026-07-15Andi——无广告、无追踪的AI答案引擎,让搜索回归干净和直接
101Andi是一款由Y Combinator孵化的AI答案引擎(Answer Engine),由95后创始人Angela Hoover创立。它结合大语言模型与实时网络数据,通过语义搜索直接返回简洁答案而非链接列表,支持Read、Summarize、Explain三大阅读工具。完全免费、无广告、无追踪,搜索请求加密且不留历史记录。
2026-07-14GitHub Copilot - AI 编程助手与智能代码补全工具
98GitHub Copilot 是 GitHub 推出的 AI 编程助手,支持在 VS Code、JetBrains、命令行等多种环境中提供智能代码补全、解释、编辑建议和自动代理执行。它集成多种领先大语言模型(如 OpenAI Codex、Claude),允许用户创建自定义代理,并通过 GitHub 桌面应用统一管理多代理工作流。企业版可定制知识库、行为策略和连接服务,已帮助 Grupo Boticário 等企业将开发效率提升 94%。
2026-07-16super.AI智能文档处理平台,自动化提取验证路由复杂文档
97super.AI是一个智能文档处理(IDP)平台,结合大语言模型、计算机视觉和人工审核,对任何类型的文档进行分类、提取、验证和路由,实现端到端自动化,保证准确性。支持处理采购订单、提单、发票、海关表格、保险索赔等复杂文档,无需设置即可快速启动。
2026-07-20Google PaLM 2——下一代多语言、强推理与代码能力的AI大语言模型
95PaLM 2是Google于2023年I/O大会推出的下一代大语言模型。它具备更强的多语言能力(覆盖100+种语言)、逻辑推理与数学能力以及代码生成能力,提供从移动端可运行的Gecko到高性能的Unicorn四种规格。PaLM 2已赋能Bard、Google Workspace、Med-PaLM 2、Sec-PaLM等超过25款Google产品,是推动Google AI战略的核心模型
2026-07-14飞书智能伙伴,AI驱动的企业协作与知识管理助手
92飞书智能伙伴是飞书推出的AI助手,集成于飞书平台,提供智能问答、文档总结、会议纪要、日程管理等功能。它利用大语言模型技术,帮助团队快速获取信息、优化工作流程、提升协作效率。支持自然语言交互,可处理企业知识库、聊天记录、文档等数据,适用于日常办公、项目管理、客户服务等场景。免费使用,助力企业数字化转型。
2026-07-20Mapify:PDF、视频和网页的AI摘要与思维导图生成器
91Mapify是一款由GPT、Gemini等顶尖大语言模型驱动的AI思维导图生成器,支持将YouTube视频、PDF文档、网页链接、播客、会议记录等多种内容一键总结为结构化的思维导图。它提供AI对话、自动转录、多语言翻译、联网搜索、图片识别、音频转导图等功能,帮助用户快速提取关键信息,提升学习和工作效率。被500万以上用户信赖,在Product Hunt上排名第三,App Store评分4.8/5。
2026-07-20文思助手 | 智能AI写作与公文助手,集成AI搜索与对话功能
90文思助手是一款强大的AI写作工具,专注于智能写作、公文写作、AI搜索和AI对话。它基于先进的大语言模型,帮助用户快速生成高质量的文章、报告、公文等文本内容。无论是职场文档、学术论文还是创意写作,文思助手都能提供精准的辅助,提升写作效率。同时集成AI搜索功能,让信息获取更便捷;AI对话模式支持交互式创作,让写作过程更流畅自然。
2026-07-22WPS AI - 智能PPT生成、文档写作与表格处理助手
90WPS AI是金山办公旗下集成大语言模型的人工智能应用,专注于提升办公效率。它支持一键生成PPT大纲、智能撰写工作周报、年终述职报告、社交媒体文案等,并提供文章改写、续写、翻译、润色等写作辅助功能。同时具备表格数据处理与分析能力,帮助用户快速完成复杂办公任务,结合WPS Office生态,实现从文档创建到内容优化的全流程智能化体验。
2026-07-20ZenMux - AI多模型混合推理平台
88ZenMux是一个创新的AI多模型混合推理平台,旨在通过智能路由和模型组合优化AI推理效率。平台支持同时调用多个大语言模型(LLM),自动选择最优模型或组合方案,以平衡成本、速度和准确性。适用于开发者、AI研究者和企业用户,帮助他们降低API调用成本、提升响应速度,并实现更复杂的推理任务。ZenMux提供灵活的API接口和可视化仪表盘,支持实时监控和模型切换。
2026-07-23ChatDOC智能文档助手,基于AI的文档阅读、问答与提取工具
88ChatDOC是一款基于AI的智能文档助手,支持上传PDF、Word、Excel、PPT等多种格式文档,通过对话方式快速提取信息、总结内容、回答问题。它利用大语言模型理解文档结构,提供精准的引用来源,适用于学术研究、法律合同、商业报告等场景,大幅提升文档处理效率。
2026-07-20Anyword AI写作助手,AI营销文案生成与优化工具
86Anyword是一款基于人工智能的营销文案生成与优化平台,专为营销人员、内容创作者和广告主设计。它利用大语言模型,帮助用户快速生成高转化率的广告文案、邮件、社交媒体帖子、落地页内容等。平台内置数据驱动的评分系统,能预测文案在不同渠道的表现,并提供个性化优化建议。Anyword支持A/B测试、团队协作,并集成Google Ads、Facebook Ads等主流广告平台,让内容创作从灵感迸发到效果优化一气呵成,显著提升营销ROI。
2026-07-24NovelistAI - AI小说创作平台
81NovelistAI是一个专注小说创作的AI写作平台,基于大语言模型,帮助作者快速生成小说情节、角色设定、对话和完整章节。支持多种文学风格和类型,如奇幻、科幻、悬疑、浪漫等,提供创意灵感激发和写作效率提升。适合小说创作者、网文作者和写作爱好者使用。
2026-07-23ChatGLM智能对话与创作助手
81ChatGLM是一款基于先进大语言模型的智能对话与创作工具,支持多轮对话、文本生成、代码编写、知识问答等功能。它能够理解复杂指令,提供高质量的回应,适用于日常交流、学习辅助、工作文档撰写和创意激发。界面简洁易用,响应迅速,是用户提升效率的得力伙伴。
2026-07-20DeepSeek深度求索AI对话与API平台,探索AGI前沿的通用大模型
79DeepSeek(深度求索)成立于2023年,专注于研究世界领先的通用人工智能底层模型与技术。平台提供免费AI对话、API开放接口调用,已发布并开源多个百亿级参数大模型,包括DeepSeek-LLM通用大语言模型、DeepSeek-Coder代码大模型、DeepSeek-MoE混合专家模型等。最新DeepSeek-V4版本具备世界顶级推理性能,Agent能力大幅提升,可在网页端、APP和API使用,助力开发者快速集成与流畅体验。
2026-07-22Unsloth AI 微调工具:快速低内存训练大语言模型的利器
72Unsloth 是一个专为加速大语言模型微调而设计的开源工具,支持 Llama、Mistral、Gemma 等主流模型。通过双量化技术和优化的内核,它能在普通消费级 GPU 上实现高达 2 倍的速度提升和 80% 的内存节省,同时保持模型精度。无需高端硬件,即可在 Colab 上免费使用,适合个人开发者和中小企业快速定制专属 AI 助手。
2026-07-26AI资讯 (4)
2026年AI最新进展推荐清单:5款高性价比产品深度测评,避免踩坑必看
492026年AI最新进展推荐清单:5款高性价比产品深度测评,避免踩坑必看 兄弟们,姐妹们,我知道你们等这篇测评等了很久了。说实话,2026年开年这波AI最新进展,简直可以用“神仙打架”来形容。从大语言模型到多模态应用,从办公自动化到创意生成,几乎每个月都有让人眼前一亮的新东西冒出来。但问题也来了——产品太多,钱包太薄,怎么选? 我花了整整三周时间,自费(对,你没看错,自费)把市面上热度最高的几款...
文心一言评测深度解析:技术架构、能力评测与适用场景全方面对比分析
46文心一言评测深度解析:技术架构、能力评测与适用场景全方面对比分析 最近后台收到好多小伙伴私信,问我到底该怎么选大语言模型,特别是对百度的文心一言,大家是又好奇又纠结。毕竟市面上ChatGPT、Claude这些海外选手热度不减,而国产之光文心一言也一直在迭代。作为一个天天泡在各种AI工具里的老油条,我今天就打算掏心窝子,给大家做一次超详细的文心一言评测,从技术底子到实际体验,咱们一次聊透。 说实...
LLM benchmark实测报告:2026年最新跑分、使用体验与横向对比,数据说话
40LLM benchmark实测报告:2026年最新跑分、使用体验与横向对比,数据说话 兄弟们,姐妹们,搞AI的各位同仁,坐稳了!今天咱们不玩虚的,直接上硬货。作为一个天天泡在模型海洋里的老司机,我深知LLM benchmark(大语言模型基准测试)这玩意儿有多重要——它就像手机界的安兔兔跑分,虽然不能完全代表真实体验,但没它还真不行。2026年刚开年,各大厂就卷疯了,新模型一个接一个往外蹦,参数...
一文读懂AI最新进展:核心技术原理与优势分析,附5个实际应用场景演示
39AI最新进展:技术浪潮下的机遇与挑战 兄弟们,姐妹们,最近AI圈简直像过年一样热闹!隔三差五就有新模型发布,感觉一天不看AI新闻就要被时代抛弃了。作为一个天天泡在AI海洋里的老司机,我今天就来带大家好好捋一捋这波AI最新进展,把那些晦涩难懂的技术黑话翻译成人话,再附上几个实战场景,保证你看完心里有谱。 说实话,写这篇文章之前,我特意去刷了一周的最新AI日报,生怕漏掉什么关键信息。从大语言模型到...
职业技能 (4)
Rain Bird IQ4 CLI 灌溉技能
这是一个基于命令行的Rain Bird IQ4云API工具,专为管理灌溉计划而设计。用户可以通过终端直接控制Rain Bird智能灌溉系统,包括查看和修改灌溉计划、调整浇水时间、监控灌溉状态等。该工具特别为LLM(大语言模型)优化,可轻松集成到AI工作流中,实现自动化灌溉管理。适用于园艺爱好者、农场管理者、智能家居用户等,提供高效、灵活的灌溉控制方案。
家庭服务技能
这是一个基于Sofia自主AI助手的家庭服务技能,专为家庭环境中的自动化任务设计。该技能利用Go语言构建的Sofia平台,集成40多种工具和20多种大语言模型提供商,支持多智能体协作和自我优化。用户可以通过该技能管理家庭相关的服务,如日程安排、提醒设置、设备控制等,适用于智能家居场景。技能通过简单的安装命令即可集成到Sofia工作区,提供灵活的任务执行和扩展能力。
大模型驱动的过敏症状追踪与健康管理工具
基于大语言模型的过敏症状追踪器,帮助用户记录每日过敏症状、触发因素和用药情况,利用AI分析症状模式、提供个性化预警和健康建议,实现智能化的过敏管理。
大模型驱动的营养顾问:智能饮食分析与个性化饮食建议
基于大语言模型的营养顾问Skill,能够根据用户年龄、性别、体重、活动水平及健康目标(减重、增肌、控糖等),提供个性化的每日营养摄入建议、食谱推荐、食物替换方案。集成食物数据库与营养成分计算,支持多语言交互,帮助用户科学管理饮食。