KNOWLEDGE INDEX · 实体

Meta AI

Meta AI

19条关联资讯

也可检索Meta

CHRONOLOGICAL RECORD

返回实体索引
2026

aibase资讯

微软测试月之暗面 Kimi K3,或将引入 Copilot 与 Azure 平台

据《The Information》报道,微软正在测试月之暗面(Moonshot AI) 最新 模型 Kimi K3,评估其接入 Microsoft Copilot 的可行性,同时推进该模型进入 Azure 平台。目前,Kimi K3仍处于微软内部测试与平台接入阶段,尚未正式成为 Copilot 可选模型,微软也未公布其在 Azure 上的具体上线时间、服务地区及定价信息。 这并非微软 首次 引入月之暗面模型。7月1日,GitHub Copilot 已正式上线 Kimi K2.7Code,将其作为首个进入 Copilot 模型选择器的开放权重模型,并由 GitHub 基于微软 Azure 提供托管服务。该模型首先面向 Copilot Pro、Pro+ 和 Max 用户开放,企业用户则需由管理员手动启用。 目前,微软已在 Microsoft Foundry 平台提供 Kimi K2、Kimi K2.5和 Kimi K2.6等系列模型。若 Kimi K3后续正式接入 Azure,企业客户将能够通过微软云计算基础设施、统一计费体系和企业管理能力调用该模型,无需直接连接月之暗面的服务。 微软持续扩展 Copilot 和 Azure 的模型选择范围,反映出其 AI 产品战略正在向多模型架构演进。除长期合作伙伴 OpenAI 外,微软近年来已陆续引入 Anthropic、DeepSeek、xAI、Meta 以及月之暗面等公司的模型,根据不同任务需求,在性能、成本和应用场景之间提供更灵活的选择。Kimi K3的潜在接入,也将进一步丰富企业级 AI 应用生态的模型供给。

2026

aibase资讯

Poolside 重磅开源!Laguna S 2.1 免费上线 OpenCode,1M 超长上下文 +118B MoE 模型引领代理编码新纪元

AIbase 报道:AI 编码领域备受关注的初创公司 Poolside 正式发布其迄今为止 最强 大模型——Laguna S2.1。该模型现已 完全开源,并在 OpenCode 平台上免费开放使用,迅速引发开发者社区热议。 模型核心参数亮点 规模与架构:118B 总参数 Mixture-of-Experts(MoE)模型,每 token 激活8B 参数。 上下文长度: 最高 支持 1M tokens,适合长周期软件工程和复杂代理任务。 推理模式:支持 thinking(思考)和 no-thinking 模式,可根据需求灵活切换。 性能定位:Poolside 官方称其能力足以与参数规模大得多的模型竞争,同时体积足够小巧,可在单台 NVIDIA DGX Spark 上运行。 开源与免费开放加速落地 Poolside 将 Laguna S2.1权重以 OpenMDW-1.1许可 完全开放,开发者可立即在 Hugging Face 获取模型文件。OpenCode 平台同步宣布该模型免费可用,强调“1M Context · fully open source”,极大降低了开发者试用门槛。 社区反馈显示,模型已在多种硬件上成功运行,包括 Apple M3Max(128GB 内存)通过 llama.cpp fork 实现,以及多机 DGX Spark 环境下的高吞吐量推理。基准测试方面,有报告提到其在 Terminal-Bench2.1上取得70.2% 的成绩,并在 DeepSWE 等编码基准中展现强劲代理能力。 Poolside 的战略布局 作为专注于代理编码(agentic coding)和长时序任务的 AI 实验室,Poolside 此前已推出 Laguna XS 系列轻量模型。此次 S2.1的发布标志着其从中端本地模型向更强旗舰能力的扩展。该模型不仅性能突出,还注重实际部署友好性,为本地、私有化部署提供了高效选择。 AIbase 点评:在开源大模型竞争日趋激烈的当下,Poolside 选择以高性能、超长上下文的 Laguna S2.1免费开放,进一步降低了开发者获取 顶级 编码工具的门槛。这不仅将推动代理 AI 在软件开发中的普及,也为开源社区注入了强劲动力。开发者们可立即前往 OpenCode 或 Hugging Face 体验这一 最新 力作。

2026

aibase资讯

Gemini 3.6 Flash来了,但网友笑得更大声:省下了token,却没保住智商

如果你从去年就开始用Gemini,最近 最流行 的一句调侃是:那种感觉就像看着自家兄弟慢慢得了阿尔茨海默症。按理说,一家公司发新模型,本该是用来打脸这种调侃的。可就在刚刚,Google一口气甩出三款新模型之后,网友非但没收回这句话,反而笑得更大声了,颇有一种他们都不看好你、偏偏你最不争气的即视感。这三款模型分别是3.6Flash、3.5Flash-Lite,以及专攻网络安全的3.5Flash Cyber,官方博客的措辞依旧眼熟,更高效、更聪明、为大规模AI agent而生,一句不落,但实际体感却冰火两重天。 先说当家头牌3.6Flash。它是今年5月I/O大会上3.5Flash的小版本迭代,官方给它的定位是真正扛活的干活模型。这一代 最大 的卖点是省token:按Artificial Analysis Index的数据,3.6Flash比3.5Flash少用了17%的输出token,在DeepSWE这类场景上甚至能省到65%,跑多步任务时推理步数和工具调用都更少。价格也确实降了,输入1.5美元每百万token、输出7.5美元每百万token,而上一代3.5Flash的输出价是9美元,这波直接砍到7.5,又快又省,单个agent任务的成本被压了下来。 基准测试上,代码能力是重点,DeepSWE从37%提升到49%,官方称多余代码改动更少、执行循环更短、生成代码更贴近生产环境要求;机器学习研究方向的MLE Bench提升更明显,从49.7%拉到63.9%;计算机操作OSWorld-Verified从78.4%升到83%,而且计算机操作本身成了Gemini API和企业版的内置工具,主打开箱即用;知识工作GDPval-AA v2从1349涨到1421,Hebbia、Harvey等客户反馈它在文档解析、图表数据分析、报告起草这类多模态任务上尤其突出,Figma、JetBrains也出面背书。一个不起眼但实在的更新是,知识截止日期终于从2025年1月推进到了2026年3月,老黄历总算翻篇。安全方面,官方说3.6Flash上了升级版Frontier Safety防护,重点盯着化学、生物、放射性、核与网络攻击这两类滥用,抗越狱能力更强,同时尽量不误伤正常需求、少乱拒绝。 比它低一档的是3.5Flash-Lite,主打快和便宜,专治高吞吐、低延迟的任务,比如agent搜索和文档处理。它是3.5系列里最快的,按Artificial Analysis测量每秒能吐350个token,价格更是白菜价,输入0.3美元、输出2.5美元每百万token,质量比3月发的3.1Flash-Lite好一大截。它支持调推理档位,低配活儿开 最低 档图快和省,碰到要多步拆解的子任务就把思考档位往上拨,电脑操作这次也做成了内置工具。 提升相当明显:代码和agent任务的Terminal-Bench2.1从31%干到54%,长上下文的GDM-MRCR v2从60.1%提到72.2%,真实任务执行的GDPval-AA v2更是从642飙到1140。最有意思的是,这个低档小弟在不少agent和代码任务上居然反超了辈分更高的3Flash,比如SWE-Bench Pro是54.2%对49.6%、OSWorld-Verified是74.0%对65.1%,等于跑3Flash的活儿现在有了个更快更强的平替。官方举了几个用法,从海量电商数据里抽产品特征、给3.6Flash当副手一口气生成25个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏,Ashler、Palo Alto Networks、Ramp这几家客户也来夸它速度、智能、成本三合一。 最后一个3.5Flash Cyber画风突变,专门用来找和修代码里的安全漏洞。Google的逻辑挺妙:现在AI找漏洞的速度已经比现有系统修漏洞快了,漏洞越堆越多,不如用便宜高效的Flash来批量补锅。这个模型在3.5Flash基础上微调出来,搭配自家的CodeMender工具,里面跑好几个Flash Cyber agent协同工作、最后汇总成一份报告,在业内知名的CyberGym基准上摸到了 第一 梯队水平,还比更大的模型更省token。不过这模型暂时用不上,考虑到找漏洞是把双刃剑,Google也学Anthropic玩起了安全叙事,把它锁得死死的,只对可信合作伙伴限量开放、走内测,目的是给一线防守方争取时间,赶在漏洞被利用前先修掉,同时防着有人拿它去干坏事。 看到这儿你可能会问,发了一堆Flash,真正的旗舰3.5Pro去哪了。官方口径是正在和合作伙伴测试、准备好就上,但这套说辞背后的故事可能没那么体面。据彭博社等媒体报道,3.5Pro的代码生成能力一直没达到内部预期,Google6月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色,更有传闻说Google干脆推翻了原来的训练方案、从零开始重训。而Google AI宣传委员Logan Kilpatrick更是索性在舆论上跳过3.5Pro,把预告重点放在Gemini4上,声称已经启动了史上最雄心勃勃的Gemini4预训练、进展让人兴奋。放在旗舰跳票的背景下看,这多少有点转移视线、画饼续命的味道。 光看今天发布的Flash模型本身,网友也并不全然买账。第三方评测机构Artificial Analysis表示,两个新模型确实把单任务耗时砍半、token效率也提升了,Flash-Lite的智能指数涨了11分,但3.6Flash的智能水平相比3.5Flash基本原地踏步。价格没便宜到足以忽略能力差距,能力也没高到能解释它的成本。X平台上有网友吐槽,3.6Flash在Artificial Analysis上跟3.5Flash拿了一模一样的分,还不如Meta Spark1.1、GLM-5.2、5.6Luna、Sonnet5、Grok4.5、5.6Terra这一票对手,直呼简直烂透了。 网友Angel则从性价比入手,指出3.6Flash的使用成本比GPT-5.6Sol medium还高、智能程度反而更低,又贵又笨的组合属实尴尬,毕竟Flash系列立身的根本就是性价比,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI的Tibo刚刚也发话,由于周活跃用户达到1000万,Codex和ChatGPT Work的付费用户迎来新一轮额度重置。这对比、这落差,还有人记得大明湖畔的Google Gemini3吗。 实测派也来补刀。网友Balder直接开团,称这三个模型性能全比之前的3.5Flash差,问题包括但不限于基础解码就有毛病、中文选词经常很离谱,生成的图片视频质量极差、跟指令对不上还限额严重,经常记忆混乱、调用完全错误的工具。他还抛出一个阴谋论,认为Google之所以这么搞,是为了把算力腾出来卖给Anthropic,阴阳了一句这就是皮查伊想要的Cloud First。X网友Conor Dart用Google自家的Antigravity跑了个AI生成游戏测试,结果木头纹理更差了、大理石看着差不多但还是不能用,他直言又是一次翻车,表示自己还是等Gemini3.5或者3.6Pro吧。 一边是官方更高效、更便宜、更省token的漂亮账本,一边是大多数网友的当场差评,以及模型背后旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇,Google这次是不是真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个Flash稳住场子。反正Gemini4的预训练都已经开跑了,这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

2026

aibase资讯

解决家长讲故事难题!Meta测试AI睡前故事应用StoryKit

为了给忙碌的家长减轻负担,科技巨头Meta目前正在试点一款名为StoryKit的AI应用。该应用专为儿童打造,能够快速生成包含自定义角色、场景和音乐的个性化睡前故事。 家长甚至不需要亲自编写内容,只需上传孩子喜欢的玩具照片即可生成生动的角色。此外,应用还支持融入勇敢、善良等教育主题,让孩子在听故事的同时自然吸收积极价值观。 注重安全管控,主打无社交环境 Meta官方证实,这款应用目前仅在部分地区进行测试,旨在评估家长的真实使用体验。为保障儿童安全,StoryKit设置了严密的AI安全过滤器,不包含任何社交功能且仅限成年人使用。 与此前引发争议的某些AI产品相比,StoryKit试图在数字时代为父母提供便利的助眠工具。即便孩子提出了极其天马行空的奇特故事需求,AI也能迅速给出完备的故事剧本。 AI替代亲子互动?引发各界人文思考 然而,这一新型应用也在社会上引发了关于“外包亲子时光”的讨论与思考。传统上,亲手为孩子构思和讲述睡前故事是增进家庭感情的重要纽带。 虽然AI工具极大地方便了日常生活,但依靠算法生成的剧本是否会削弱人类原本的想象力仍未可知。如何在享受科技便利的同时保留温情的人文连接,成为了不少家长需要权衡的新课题。

2026

aibase资讯

Meta 正在部分国家和地区测试 AI 睡前故事应用 StoryKit

Meta 于2026年7月21日宣布,正在部分国家和地区测试一款名为StoryKit的全新 AI 故事创作应用程序。该应用旨在帮助家长为儿童制作个性化的故事书,支持自定义角色、场景、价值观课程及背景音乐。 用户可通过拍摄玩具或人物照片生成虚拟角色,并为其设定世界观与道德主题。官方强调,该应用仅限18岁以上用户使用,内置 AI 安全过滤器,且不包含任何社交功能。 作为 Meta 在消费级生成式 AI 领域的又一次探索,StoryKit反映出科技巨头正加速将大模型技术渗透至日常生活的细分场景中。在面临市场对其此前多款 AI 娱乐及硬件产品评价不一的背景下,此类应用的测试不仅展示了多模态及文本生成技术在个性化内容分发上的潜力,也再度引发了行业关于技术边界、儿童心理健康以及人类传统亲子互动模式可能被重塑的深度讨论。

2026

huggingface-papers论文

用于评估开放式生成的两级元评分标准:GAMUT,一个事实完整性基准

Evaluating the factuality of long-form generations has focused predominantly on precision, measuring whether the claims a model makes are correct. The dominant decompose-search-verify pipeline catches incorrect claims well but says little about whether a response contains all the information it should. Measuring factual completeness, the missing half of factuality, is harder: it requires enumerating the full set of facts a complete answer should contain, and these facts rarely form a flat list. They often involve open-ended sets where coverage is what matters, ordered processes, and relationships among facts that a list of independent boolean checks fails to capture. We introduce a two-level meta-rubric framework for evaluating open-ended generation, and instantiate it as Gamut (Grounded Assessment of Multimodal Factuality), a benchmark for factual completeness in long-form generation. The framework rests on a two-level rubric representation: a structured meta-rubric captures the organization and importance of the required content, which is then mechanically compiled into a flat checklist of binary, machine-gradable rubrics that an LLM judge scores reliably. We construct 1,813 questions grounded in real wearable imagery across 10 diverse domains, each paired with an evidence-backed rubric verified by expert human annotators. Because the framework is modality-agnostic, we also release a text-only variant. Evaluating 14 frontier and open-weight models, we find the benchmark genuinely challenging (best score 58.7% from Gemini 3.1 Pro), highly discriminative, and robust to the choice of judge.

2026

aibase资讯

五大科技巨头隐性债务激增至 1.65 万亿美元,投资风险加剧!

在人工智能投资如火如荼的今天,美国五大科技巨头的隐性债务也随之大幅攀升。根据日经新闻的研究报告,这些公司的隐性债务在过去四年内激增了八倍,达到了惊人的 1.65 万亿美元远超它们的实际债务水平。 那么,这些隐性债务是从何而来的呢?主要源于企业在数据中心租赁和图形处理单元(GPU)供应合同上的大额支出。例如,Meta(前身为 Facebook)的隐性债务高达 4200 亿美元,几乎是其透明债务的三倍之多。这一情况让投资者在评估这些科技公司的财务健康状况时变得更加困难。 隐性债务的飙升不仅影响了公司的财务透明度,也给投资者带来了潜在的风险。由于这些债务往往未被充分披露,投资者在考虑长期投资时,难以全面了解公司的负债状况,从而可能会做出错误的决策。日经的研究提醒投资者,要特别注意这些隐藏在财务报表背后的 “黑洞”。 可以说,这一现象与当前的 AI 军备竞赛密切相关。各大科技公司纷纷加大对人工智能的投资,然而,快速扩张的背后是日益增加的债务压力。对于那些押注于 AI 长期增长的投资者而言,理解和掌握这些隐性债务的真实情况,是降低投资风险的关键。 随着科技行业的迅猛发展,投资者和分析师需要更加这些潜在的财务隐患,以便做出更明智的投资决策。隐性债务的巨大规模,可能会在未来对市场产生深的影响。

2026

aibase资讯

美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需

OpenAI前首席技术官穆拉蒂离开老东家后交出的 第一 份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布 首款 模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺 第一。 单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。 真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。 一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室, 首款 模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现 最强 的模型,无论开放模型还是闭源模型。 把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。 当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的 第一 梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。 之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。 穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。 但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。 Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。 真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有 顶尖 团队、充足资金和英伟达 最新 训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。 按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准 第一。 公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准 第一 并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。 美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%, 最高 一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测 最强 的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分 顶级 闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。 与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。 这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。 从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。

2026

aibase资讯

Anthropic Fable 5 训练成本三倍于开源模型,未来面临挑战

在最近的一次分析中,Wojciech Gryc 探讨了 Anthropic 的 Fable 5 与两款中国新模型的市场竞争情况。Moonshot 于 7 月 16 日推出的 Kimi K3 和阿里巴巴于 7 月 19 日发布的 Qwen 3.8 都达到了与 Fable 5 相似的性能,并且这两款模型将开源其权重。 Gryc 指出,训练前沿 AI 模型的主要成本来自研究人员和算力,但在模型训练完成后,推理成本才是真正的开销。每当用户调用 API 时,都会消耗大量的 GPU 资源和电力。他认为,如何支付推理成本将直接影响公司的商业模式。 他将 AI 公司分为三类: 第一 类是租用数据中心并支付电费的公司,如 Anthropic、Moonshot 和智谱(GLM 5.2);第二类是自建数据中心的公司,如 Meta 和阿里巴巴;第三类是拥有自发电能力和自建数据中心的公司,如 SpaceX。Gryc 强调,拥有基础设施的公司即使在模型性能上不是 最优,依然能通过出租服务器获得盈利。 此外,Gryc 指出 Anthropic 的 Fable 5 在单个任务的推理成本上几乎是 OpenAI 和开源模型的三倍。这样的高成本在竞争激烈的市场中是否能被用户接受,是一个值得关注的问题。他认为,当前市场上的基准测试已趋于饱和,用户对于模型的感知差异远低于成本差异,可能导致 Anthropic 面临被市场抛弃的风险。 与之相比,OpenAI 则凭借其全面的产品线和数据中心的布局展现出更强的市场竞争力。Gryc 预计,当前这一波竞争将持续发展,多家实验室可能会在未来不断超越传统的美国科技巨头。 划重点: 🌟 Fable 5 的推理成本是 OpenAI 和开源模型的三倍,面临市场压力。 🔍 Gryc 将 AI 公司分为三类,指出基础设施的重要性。 📈 竞争持续加剧,多家中国实验室正在快速追赶甚至超越美国公司。

2026

新智元资讯

5.83倍加速!PolicyTrim:让VLA机器人少走弯路、更快完成任务

新智元 2026-07-21 12:58 北京 新智元报道 【新智元导读】 VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。 Vision-Language-Action(VLA)模型把视觉观测、语言指令和机器人动作统一到一个策略模型中,使机器人能够根据自然语言完成复杂操作任务。 从OpenVLA、OpenVLA-OFT到π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。 但当VLA模型真正部署到机器人上时,一个关键瓶颈会立刻显现:机器人完成任务的总时间,不只取决于每次推理有多快,也取决于策略到底需要执行多少次推理、多少个真实物理动作。 在同一任务的多次rollout中,VLA模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。 动作chunk尾部不可靠:模型一次预测多个动作,但越靠后的动作越容易累积误差,系统不得不频繁重新规划,强行拉长执行长度会降低成功率并增加物理步数。 物理动作冗余严重: 即便任务最终成功,轨迹里也可能包含大量纠错、回退和重复动作。 因此,VLA部署效率不仅要看每一步的推理延时,更要看策略效率(policy efficiency): 一次预测中有多少动作能放心执行?完成任务到底需要多少真实物理步骤? 已有方法大多从 计算侧 入手,例如视觉token剪枝、量化、KV-cache复用、蒸馏或推理引擎优化。这些方法可以降低单次推理延迟,但如果策略仍然需要大量冗余物理步骤,真实任务耗时仍然很长。 直接固定执行更长action chunk也并不可靠。 论文中的实验显示,随着强行将动作执行长度变长,成功率可能下降,物理步数反而增加。这说明低质量的尾部预测会把误差带入物理世界,机器人随后需要更多纠错动作。 关键问题:能否在不牺牲任务成功率的前提下,通过后训练,让已有VLA策略自动学会「少走弯路」,用更少物理步骤完成任务? 来自四川大学雷印杰教授领导的团队提出了PolicyTrim——一个面向「策略效率」的两阶段强化学习后训练框架。它不改变VLA架构,也不重新收集专家数据,而是在已有预训练策略之上继续优化机器人真实执行行为。 项目主页: 论文链接: 代码链接: 模型链接: 新方法实现了: 3×动作chunk利用率,更长horizon可靠执行; 51.4%物理步数减少,压缩冗余修正动作; 5.83×端到端最高加速,LIBERO Object/π0.5; 从「算得更快」到「做得更快」 PolicyTrim的核心目标不是替代计算侧加速,而是补上另一个被忽视的维度:减少完成任务所需的前向推理次数次数。它把策略效率拆成两个可优化目标:先扩展可靠动作chunk,再压缩冗余物理步骤。 1. 可靠动作chunk扩展(Reliable Action Chunk Extension) 当前很多VLA策略以action chunk形式输出动作序列,但部署时往往只敢执行前几步。PolicyTrim第一阶段使用dynamic execution horizon exploration:同一组rollout分配不同接受比率,让模型在短、中、长窗口上并行探索可靠边界。 成功完成任务且执行窗口更长的轨迹获得更高reward,鼓励模型把原本不可靠的chunk尾部动作变得更可用。 horizon reward只在组内出现成功轨迹时激活,避免模型在失败情况下盲目追求更长的chunk长度。 2. 冗余感知的步数压缩(Redundancy-Aware Step Reduction) 当可靠horizon被扩展之后,第二阶段进一步减少总物理步数。PolicyTrim引入step-saving reward:成功轨迹用越少步骤完成任务,奖励越高。 step-saving reward 直接把「更短、更直接的成功轨迹」写进优化目标。 group-anchored regularization 抑制不可复现的投机捷径,避免模型只追求短路径却损害成功率。 两阶段顺序优化可以避免「拉长chunk」和「缩短步数」两个目标互相干扰,最终减少完成任务所需的前向推理次数次数。 实验结果 论文在LIBERO、ManiSkill、Meta-World以及真实机器人任务上验证了PolicyTrim,并覆盖π0.5、OpenVLA-OFT、GR00T等不同VLA架构。总体结果显示,PolicyTrim在保持任务成功率稳定的同时,显著提升执行效率。 在LIBERO中,π0.5达到最高5.83倍端到端加速,同时成功率保持98%以上。 跨基准结果显示,PolicyTrim在ManiSkill上最高达到2.36倍加速,在Meta-World上达到2.52倍加速。 跨架构结果显示,重新预训练后的OpenVLA-OFT采用完整两阶段流程可达到2.97倍加速;OpenVLA仅使用第二阶段也能达到1.41倍加速。 定性对比:少走弯路,轨迹更直接 在随机采样的LIBERO任务中,Baseline往往出现冗余纠错动作和目标附近的hesitation/jittering;PolicyTrim的轨迹更平滑、更直接,能够用更少物理步骤完成同一任务,通常能将物理步数压缩至原来的一半左右。

2026

数字生命卡兹克资讯

AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜。

原创 数字生命卡兹克 2026-07-21 09:11 北京 一个Token验真伪 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 Llama 3.3,则多数是53。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。 所以说,为啥 布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证, 看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。 只需要模型输出一个 Token,就够锁定你是谁。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 而且这事之所以这么普遍,纯粹是经济结构决定的。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 但问题在于, CISPA 这套 LLMmap的 方法依然很重。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的 LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个

2026

aibase资讯

Anthropic获批15亿美元版权和解协议,将向50万部作品支付赔偿

据路透社报道,美国联邦法院周一正式批准Anthropic公司与作家、出版商达成的15亿美元集体诉讼和解协议。该协议用于解决Anthropic因训练AI模型过程中涉嫌侵犯版权引发的诉讼,公司随后将开始向相关版权方支付赔偿。 美国加州北区地方法院法官Araceli Martinez-Olguin签署了最终批准文件。此前,已退休法官威廉·阿尔苏普曾初步批准该和解方案,并裁定Anthropic曾非法下载并存储数百万本受版权保护的书籍。 根据赔偿方案,每部涉案作品预计可获得3000美元赔偿,涉及作品数量约50万部,赔偿金额将由拥有版权的作者和出版商共同分配。这一金额被认为是美国版权法领域规模 最大 的和解之一。 不过,该协议并未完全解决围绕AI训练数据的法律争议。阿尔苏普法官此前在案件核心问题上支持Anthropic,认为利用受版权保护文本训练AI模型可能属于“合理使用”范畴,被业内视为AI版权判例的重要进展。但与此同时,他指出Anthropic获取部分训练数据的方式存在违法问题。 Anthropic此前主要通过两种方式获取训练数据:一部分来自合法购买并扫描的书籍,另一部分则来自Library Genesis、Pirate Library Mirror等盗版网站下载的内容。法院认为,后者涉及非法获取版权材料。为避免进一步审判以及可能面临的高额赔偿,Anthropic最终选择达成和解。 业内人士指出,虽然此次和解结束了该案件,但并未形成针对整个AI行业的统一法律标准。由于Anthropic选择和解,案件未进入上诉程序,阿尔苏普此前关于AI训练“合理使用”的判断也不会成为具有约束力的司法先例。 目前,围绕AI模型训练数据版权问题的诉讼仍在持续,包括针对谷歌、Meta、Midjourney和OpenAI等公司的相关案件。近期,Hachette、Cengage、Elsevier、作家Scott Turow以及SCRIBE等出版机构和作者还联合起诉谷歌,指控其未经授权使用版权作品训练Gemini人工智能平台。 随着生成式AI快速发展,如何平衡模型训练需求与版权保护,正成为全球AI产业面临的重要法律与商业挑战。Anthropic和解案虽然提供了一种解决路径,但行业关于AI数据合规的长期规则仍待进一步明确。

2026

量子位资讯

AI医疗卷了10年终于悟了:不用替代医生,而是给医院装上超强buff

原创 关注前沿科技 2026-07-20 19:41 上海 未来的医院,可能不只存在于一栋楼里 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 今年WAIC现场,300多款产品全球首发,1100多家企业把10万平米的展馆塞得满满当当。 机器人在跳舞,大模型在对话,Agent开始进入越来越多行业。 热闹归热闹。 但如果你穿过人流,走到 联影智能 的展台和论坛现场,会听到一个 既熟悉又陌生 的词 —— 元医院。 为什么说熟悉?你不觉得乍一听,瞬间让人想起几年前那个风靡全球的「元宇宙」嘛! 彼时,Meta豪掷千亿美元押注虚拟世界,全球科技公司纷纷入场,所有人都在讨论:下一个互联网入口,会不会来自一个平行数字世界? 但几年过去,元宇宙并没有成为那个答案。 就在行业以为「元」字热已经退去时,没想到,2026年,它却出现在了医疗行业。 在今年世界人工智能大会上, 联影智能首次发布「元医院」战略。 但它想做的事情, 和元宇宙完全不同。 它不新建虚拟医院、不替代医生,而是把零散AI工具整合为全院协同的智能体系。 论坛现场,有多年临床经验的医生直言,「元医院」拓宽了医生的诊疗能力边界,但同时,会对医院的算力、全域医疗数据提出指数级的上涨需求。 什么是「元医院」? AI正在快速进入千行百业。 过去几年,AI医疗已经诞生了大量应用。 影像辅助诊断帮助医生提高阅片效率,病历生成减少重复工作,智能问答降低信息查询成本,大模型也让医疗AI拥有更强的理解和推理能力。 但这些应用都有一个共同特点: 它们更多是在增强某一个环节,就像医院里增加了一批新的工具。 但真正复杂的医疗场景,并不是一个个孤立任务。 一个患者从挂号到诊疗,往往涉及影像科、检验科、临床科室、随访管理等多个环节。 医生需要综合大量信息,结合经验做出判断。 于是,一个新问题随之出现: 这些AI能力能不能像医院里的不同科室一样,被组织起来,围绕患者形成完整服务能力? 这也是「元医院」试图回答的问题。 毕竟当前优质医生资源仍然有限、医疗资源区域分布不均、医院能力受物理空间限制的问题,还无法被零散的AI能力所解决。 医疗能力急需被系统化生产。 而「元医院」,简单理解,并不是要建虚拟医院,也不是多个AI工具集合体,而是医院运营模式的系统化重构。 它是以 「 元技术」 升维医院能力,让医疗服务突破物理边界,从而解决医疗困境的全院级、数智化医院运营新模式。 「元技术」又包括啥呢? 多模态大模型、数智孪生、智能可穿戴、区块链、具身智能、云平台技术、互联网IT技术、物联网、边缘计算技术 、医疗大数据、三维渲染、元宇宙、空间智能等。 元医院与元宇宙的区别在于,后者构建虚拟空间,而前者增强现实医疗体系。 与传统智慧医院的区别在于,智慧医院更多是在原有体系上做数字化升级,比如电子病历、线上挂号、远程问诊。 而元医院试图改变的是:医疗能力如何被生产、组织和调用。 想更好地理解这一点,咱不妨换个角度。 过去的大饭店,能服务多少人取决于门店面积和厨师数量。 外卖平台出现后,餐厅依然存在,厨师依然重要,但餐厅的服务半径被扩大了。 对应到「元医院」也类似。 医院仍然存在,医生仍然是核心决策者,但医院能力可以突破物理空间的限制。 医生可以借助AI完成更多复杂任务。患者也可以获得更加持续的健康管理。 总结来说,元医院不是替代医院,而是让现实中的医院拥有更大的能力边界。 建一座「元医院」比造AI工具难多了 一家物理世界的真实医院想要运转,需要土地、建筑、设备、医生和运营体系。 同样,建设一座「元医院」,也不是部署几个AI应用那么简单。 数据、模型、智能体调度、临床验证,四项能力缺一不可。 数据能力 如果说传统医院建设的第一步,是修建土地、建筑、水电和信息系统,那么元医院首先需要搭建的是医疗数据底座。 因为数据是元医院持续运行和进化的基础。 不同于传统AI应用,元医院面对的是复杂的医疗场景。 它需要理解患者完整的诊疗过程,而不是只处理某一次检查或某一份报告。 也就是说,元医院需要的并不是单一数据源,而是一套持续运行的真实世界医疗数据网络。 这些数据贯穿诊疗全流程,覆盖影像、病历、检验、生命体征监测等多个场景,并随着真实医疗过程不断产生和更新。 但医疗数据并不容易被AI直接理解。 过去,医院中的数据长期分散在不同系统中: 影像存在影像系统,电子病历存在HIS、EMR系统,检验数据又属于另一套业务流程。 与此同时,不同医院、不同设备、不同系统之间的数据标准也并不统一。 对医生而言,这些信息可以通过长期临床训练和经验积累被串联起来。 但对于AI来说,分散的数据不会自动形成关联。 如何将不同来源、不同格式的医疗数据进行治理、连接和整合,让它们成为可被AI调用的基础资源,是元医院首先需要解决的问题。 它不仅需要数据入口,更需要建立覆盖数据采集、治理、流转和应用的完整数据能力。 这也是为其后续提升模型能力打下基础。 模型能力 数据进入系统只是第一步,接下来还要让AI理解医疗。 传统医院靠的是医生团队。医生经过多年医学训练,积累大量病例经验,形成诊断、治疗和决策能力。 而在元医院里,这种能力需要由医疗大模型重新构建。 但元医院需要的并不只是一个基座医疗大模型,而是一套能够持续生成医疗智能体的模型底座。 在这个前提下,参数不是考察医疗大模型最重要的指标。 反而是能否真正理解医疗流程,能否将医学知识、患者数据和诊疗场景连接,并在复杂情况下,做出符合医疗逻辑的判断,更重要。 前段时间开源的uAI Nexus MedVLM(中文名:元智医疗视频理解大模型),探索的就是这一方向。 依托这样的底座,元医院能够将不同来源、不同模态的数据进行理解和推理,并进一步生成面向具体场景的医疗智能体。 简单理解,模型就是元医院的「大脑」,负责将数据转化为医疗智能。 智能体调度能力 一个个医疗智能体,依托医疗大模型不断生成。 如何让这些Agent协同工作,像传统医院中的不同科室一样完成复杂诊疗任务,是「元医院」需具备的又一项核心能力。 过去,大量医疗AI应用解决的是单点任务: 一个模型看片,一个模型写报告,一个模型回答问题…… 但真实临床流程往往涉及多个环节,单一AI能力很难独立完成。 例如,一个病例可能同时需要影像分析、病历理解、知识检索、治疗建议、随访管理等多个智能体参与。 当智能体越来越多,如何让它们协同工作,成了关键。 元医院需要一个能够理解临床任务,并根据需求调用不同智能体与Skill的「 调度中枢」。 在WAIC论坛上,联影智能带来了 「超级医生」。 现场,复旦大学附属中山医院肝胆肿瘤与肝移植外科孙云帆教授戴上VR头显,来了一把沉浸式实操演示。 他视野内的三维画面同步投屏给台下所有观众。 「小U,调取这位患者完整病历。」随着语音指令下达,这名患者全周期诊疗档案立刻完整呈现: 历次就诊记录、全套影像、检验指标、既往病史一目了然,无需医生手动翻找多个系统。 手术规划环节,「超级医生」同样能提供完整辅助。 孙云帆现场下达指令:小U,剥离肝脏实质。 虚拟模型瞬间完成组织剥离,肝内胆道、动脉、门静脉、肝静脉等关键管道清晰立体呈现。 据孙云帆介绍,肝脏手术最大难点,

2026

huggingface-papers论文

语义空间的几何:Transformer架构的连续几何框架

We present a continuous geometric framework that models the discrete algebraic operations of the Transformer architecture as an integro-differential equation (IDE) on a semantic fiber bundle calE = calM times R^d. Beginning from a single geometric axiom -- that the token sequence forms a discrete 1-manifold equipped with a canonical measure lattice -- we translate every core component of the modern Transformer (RMSNorm, RoPE, Softmax Attention, FFN, Residual Stream, SGD, Weight Decay) into a cohesive vocabulary of differential geometry, measure theory, and stochastic calculus. The resulting framework yields quantitative predictions spanning entropic optimal transport (Attention as a Schrödinger bridge) and non-equilibrium thermodynamics (SGD as Itô diffusion violating detailed balance). We conduct a six-part experimental campaign across five architectures (Qwen3, LLaMA\nobreakdash-3.1, Gemma\nobreakdash-3, GPT-2, Mistral) spanning 124M to 8B parameters. The empirical observables are quantitatively consistent with the geometric predictions: the ε^{-1/2} Lipschitz scaling calibration at machine precision (R^2 = 1.000), the Lie--Trotter operator-splitting torsion, the symmetric ablation instability confirming the Dual-Law of Topological Stability, the calO(1/k) thermodynamic suppression of Poincaré recurrence on the RoPE torus, the thermodynamic context-limit phase transition, and the Non-Equilibrium Steady State parameter vortex -- verified across two optimizers (AdamW and Pure SGD) to exclude momentum artifacts. The results demonstrate that analyzing Transformers through the lens of continuous stochastic differential geometry provides a predictive descriptive vocabulary for the stability limits, context bounds, and optimization dynamics of Large Language Models.

2026

aibase资讯

一行GitHub代码出卖了AMD:Anthropic被曝成其新客户,算力去英伟达化加速

一行原本不该暴露商业机密的公开代码,把Anthropic的下一手芯片布局捅了出来。据芯片行业分析机构SemiAnalysis解读,AMD AI业务 高级 总监在GitHub上公开发布的代码里,明确留下了Anthropic将作为AMD客户的痕迹。这桩非官方、非媒体报道的泄露,指向一个清晰的信号:Anthropic正在主动拓宽芯片来源,把算力供应商从单一名单里解放出来。 周一,SemiAnalysis在社交平台X上抛出分析帖,结论正来自对AMD那位 高级 总监公开代码的专业拆解——代码内容直接涉及Anthropic作为AMD客户的相关信息。该机构表示,后续还会进一步解释代码细节与背后背景。若这一判断属实,AMD将拿下一块此前由英伟达与谷歌牢牢把持的高端AI训练市场的新阵地,而Anthropic的算力基础设施,也由此向多元化方向再踩一脚油门。 这次信息的流出路径颇为特殊。它没有走官方公告,也不是记者挖到的猛料,而是源于AMD内部高管亲手推到GitHub上的代码。SemiAnalysis把这堆代码读出了名堂,再搬到X平台上公开结论。在科技行业,这种靠公开代码库意外泄密的戏码并不鲜见——GitHub天然可被检索,而发布者又是AMD AI业务的 高级 总监,两相结合之下,信息的可信度反倒不低。SemiAnalysis在帖文中承诺,会继续把代码逻辑一层层拆开,给市场一份更完整的解读。 事实上,在AMD这条线曝光之前,Anthropic的算力采购早已不是独木桥。谷歌的TPU(张量处理器)是其重要算力来源之一,这与谷歌对Anthropic的战略投资密不可分;此外,三星也已经被纳入它的供应商体系。既有的布局说明,Anthropic从一开始就不是单点押注,而是在刻意织一张多元化的供应商矩阵,AMD的加入,只会让这张网在英伟达GPU之外,再多出一块高性能算力的选择。 对Anthropic而言,把AMD拉进阵营有多重战略分量。随着模型训练与推理规模持续膨胀,单一芯片供应商带来的供应链风险、被压制的议价能力,以及技术路径被锁死的后患,都日益刺眼。同时拥抱谷歌TPU、三星与AMD,它得以在成本控制、供应稳定和技術灵活性之间,重新寻找更优的平衡点。对AMD来说,拿下Anthropic则是一次标杆性的胜利——这家公司近年来持续重注数据中心AI芯片,其MI系列GPU被视作英伟达H系列产品的主要竞争对手之一;一旦Anthropic正式入账,AMD不仅能在 顶级 AI实验室的客户群里刷出更强的存在感,也为数据中心AI芯片业务带来实实在在的增量收入。 Anthropic的这一步,折射的是整个行业的系统性转向。当OpenAI、谷歌DeepMind、Meta AI等头部机构对算力的渴求节节攀升,AI公司正在不约而同地评估并拓展芯片供应来源,只为避开把鸡蛋放进同一个篮子里的风险。这种集体转身,客观上为AMD、英特尔等英伟达的追赶者,撬开了一道进入核心AI客户供应链的缝隙。

2026

twitter-elvis资讯

Man, it's baffling to me that people either forget too quickly about the

Man, it's baffling to me that people either forget too quickly about the impact of open source or are just too lazy to pick up a book and read about it. Having worked on open-source tools all these years, it's really sad to see such ignorance. Thanks for reminding people, Yann. Yann LeCun: @hosseeb @deanwball Soooo, releasing Linux was dumping? Apache, MySQL, PHP? HTTP, TCP/IP, OpenSSL, OpenSSH? Libjpeg, VLC? The open source software stack of the mobile communication network? Signal? PyTorch? Llama?

2026

newest submissions : artificial资讯

2026 年,哪些 MCP 服务器值得为非开发工作安装?分享我在编程之外的发现

Out of ~30 MCP servers I tested for non-dev work over 4 months, I kept 8 in daily rotation. The ecosystem hit 10K+ servers by early 2026 (22K+ on Glama by May) but most are either demo-ware or duplicate coverage. Sharing the honest cut because "MCP for non-devs" posts usually list every option without saying which ones survive real use. The keepers for marketing/social. PostFast handles cross-platform scheduling from Claude, 11 platforms including Google Business Profile which nobody else keeps now that Buffer dropped it, €10/mo. Analytics are thinner than Metricool so I run both. Metricool at $22/mo covers analytics + scheduling with an official server at ai.metricool.com/mcp. Vista Social has 35+ MCP tools at agency scale ($120/mo). For SEO research, Ahrefs MCP is solid but pricey ($129/mo starter), Semrush overlaps. Tally is the free win, 21 MCP tools for forms with OAuth setup any non-dev can wire up in 2 min. Docs and knowledge work. Notion MCP is the obvious install if you already pay for it, lets Claude create pages, update databases and read across your workspace. Slack MCP is decent but read/summarize is where it shines, message posting still feels risky without human approval. Linear MCP for project tracking works well if that's your stack. Airtable overlaps with Notion for most workflows, only worth it if it's your source of truth. CRM and sales. HubSpot MCP is the best-supported CRM server, full read/write, works with Claude and ChatGPT out of box. Salesforce has AgentForce but no open MCP server on par with HubSpot yet. For outbound sales specifically, Amplemarket scored highest in recent benchmarks (find, enrich, sequence, enroll all in one), Apollo is close second and cheaper. Ads and analytics. BigQuery MCP auto-enables on all Google Cloud projects after March 2026 so most already have it. Google Ads MCP, Meta Ads MCP and GA4 MCP each ship official servers, downside is you need read-only setup or Claude will fumble a tool call and mess with budgets. SegmentStream unifies attribution across channels which is the missing piece for most stacks. What I skipped. Zapier/Make MCP feel redundant if you already have direct servers for the tools they wrap, extra layer of latency and cost. Airtable if Notion covers you. Anything on Glama with under ~50 stars, ecosystem quality is a coin flip and 41% of public MCP servers have no auth per security audits, only 8.5% use OAuth. Stick with vendor-maintained (official) or well-audited community ones. submitted by /u/Purple_Network3016 [link] [comments]

2026

aibase资讯

NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本登顶 RTEB 检索基准

NVIDIA 近日发布了 Nemotron3Embed 系列嵌入向量模型,专为生产级 RAG、智能体检索、代码检索及智能体记忆等场景设计。其中8B 版本在检索嵌入基准测试 RTEB 上排名 第一,成为当前该领域性能 最强 的开源模型。 该系列包含三个开放检查点:Nemotron-3-Embed-8B-BF16(精度优先)、Nemotron-3-Embed-1B-BF16(轻量化版本)以及 Nemotron-3-Embed-1B-NVFP4(针对 Blackwell 架构优化的4比特版本)。三者均采用双向注意力掩码训练的 Transformer 编码器, 最大 序列长度均为32,768个 token,支持34种语言,并采用 OpenMDW-1.1许可协议开源。值得注意的是,其基础模型均基于 Mistral 架构,8B 版本源自 Ministral-3-8B-Instruct-2512,两个1B 变体则基于 Ministral-3-3B-Instruct-2512。 在 RTEB 基准的16项公开任务测试中,8B-BF16版本以平均 NDCG@10得分78.46位列榜首。1B-BF16版本得分72.38,相较上一代基线 llama-nemotron-embed-vl-1b-v2提升了10.4分。而针对 Blackwell 优化的1B-NVFP4版本仅损失0.38分,相当于保留了99.5% 的精度,同时在 Blackwell 架构上吞吐量比 BF16提升2倍。 1B 模型的构建采用了压缩而非小规模训练的路径。研发团队先使用 NVIDIA ModelOpt 的神经架构搜索将3B 基础模型剪枝至2B,再从微调后的8B 嵌入向量教师模型中通过余弦距离损失和均方误差损失进行知识蒸馏,最终迭代至1.14B 参数。NVFP4版本则在此基础上进行了量化感知蒸馏,使用512个样本校准、2万个样本训练,在长输入场景下恢复了精度。 在部署层面,三个版本存在差异:8B 和1B 的 BF16版本支持 Transformers 和 Sentence Transformers 框架,而1B-NVFP4仅支持 vLLM0.25.0的 /v2/embed 接口。微架构覆盖方面,NVFP4版本兼容 Ampere、Hopper、Lovelace 和 Blackwell,而 BF16版本主要面向 Ampere、Hopper 和 Blackwell。NVIDIA 还发布了针对1B 模型的优化版 NIM 微服务,基于 Rust 构建,在 GB200和 RTX PRO6000上达到或超越了 vLLM 检查点的性能。 应用场景方面,该系列模型支持多语言企业搜索(跨语言检索)、代码检索(训练数据包含 SWE-bench 等代码数据集)以及智能体记忆(32K token 长上下文支持较长对话摘要嵌入)。对于成本敏感场景,可采用"1B-NVFP4处理高容量召回 +8B 处理困难查询"的分层 RAG 策略。 NVIDIA 同时提供了完整的代码示例,涵盖基于 Sentence Transformers 的本地推理和基于 vLLM 的服务端部署,查询和文档分别通过 `query:` 和 `passage:` 前缀区分,嵌入向量经 L2归一化处理后点积即等于余弦相似度。