KNOWLEDGE INDEX · 实体
微软
Microsoft
17条关联资讯
也可检索Microsoft AI · 微软
CHRONOLOGICAL RECORD
按时间查看
Mistral与微软扩大战略合作并获数十亿美元投资,加速构建企业级可控制AI。
微软的多亿美元投入将帮助Mistral建设AI基础设施,为企业和受监管行业提供更前沿的模型。
三星计划投资 Mistral AI,力求打破美国科技巨头的垄断
三星电子正在与法国 AI 初创企业 Mistral 洽谈一项数亿欧元投资。这笔资金将有助于 Mistral 在市场上建立竞争力,发展能够与美国科技巨头相抗衡的主流人工智能解决方案。知情人士透露,这轮融资完成后,Mistral 的估值预计将达到约 200 亿欧元。 三星的投资规模预计为 10 亿欧元,此前该公司已经通过其风险投资部门向 Mistral 进行了投资。此次谈判反映了当前行业面临的重大趋势,即对计算能力的需求急剧增加,而相应的计算资源却持续短缺。因此,越来越多的 AI 研发企业寻求与半导体供应商建立合作关系,以满足市场需求。 在此背景下,Mistral 正好利用了机会,吸引了来自各方的资金支持。特别是在美国政府禁止外国实体获得 Anthropic 最新 AI 模型的情况下,欧洲和亚洲的企业及政府更加希望减少对美国 AI 技术的依赖。Mistral 专注于开源 AI 模型,允许客户对模型进行定制,避免了被企业或政府远程关闭的风险。 Mistral 的融资计划还包括瑞典机构 EQT 旗下的 Scaleup Europe Fund,该基金获得了欧盟委员会的支持,并致力于扶持有潜力的欧洲企业。Mistral 与三星的合作将在当前 AI 行业面临芯片紧缺的环境中进行。近期,美国内存制造商美光与 Anthropic 达成了合作,而 Mistral 也在与早期投资者微软扩大合作关系,微软承诺投入 “数十亿美元”,以采购 Mistral 的算力基础设施服务。
微软测试月之暗面 Kimi K3,或将引入 Copilot 与 Azure 平台
据《The Information》报道,微软正在测试月之暗面(Moonshot AI) 最新 模型 Kimi K3,评估其接入 Microsoft Copilot 的可行性,同时推进该模型进入 Azure 平台。目前,Kimi K3仍处于微软内部测试与平台接入阶段,尚未正式成为 Copilot 可选模型,微软也未公布其在 Azure 上的具体上线时间、服务地区及定价信息。 这并非微软 首次 引入月之暗面模型。7月1日,GitHub Copilot 已正式上线 Kimi K2.7Code,将其作为首个进入 Copilot 模型选择器的开放权重模型,并由 GitHub 基于微软 Azure 提供托管服务。该模型首先面向 Copilot Pro、Pro+ 和 Max 用户开放,企业用户则需由管理员手动启用。 目前,微软已在 Microsoft Foundry 平台提供 Kimi K2、Kimi K2.5和 Kimi K2.6等系列模型。若 Kimi K3后续正式接入 Azure,企业客户将能够通过微软云计算基础设施、统一计费体系和企业管理能力调用该模型,无需直接连接月之暗面的服务。 微软持续扩展 Copilot 和 Azure 的模型选择范围,反映出其 AI 产品战略正在向多模型架构演进。除长期合作伙伴 OpenAI 外,微软近年来已陆续引入 Anthropic、DeepSeek、xAI、Meta 以及月之暗面等公司的模型,根据不同任务需求,在性能、成本和应用场景之间提供更灵活的选择。Kimi K3的潜在接入,也将进一步丰富企业级 AI 应用生态的模型供给。
Google 发布 Gemini 3.6 Flash 等三款新模型,输出费用降低且速度翻倍
3.6 Flash 输出价格从每百万 token 9 美元降至 7.5 美元,生成速度升至 304 tokens/s,知识截止于 2026 年 3 月,已集成至 GitHub Copilot 和 Google AI Studio。
节省 40 亿元还是触发监管?微软拟为Copilot引入国产AI模型陷两难
为了降低高昂的AI运营成本,微软目前正在评估将中国人工智能公司月之暗面研发的Kimi K3 模型引入其Copilot服务。此前该服务主要依赖OpenAI与Anthropic的技术,而新模型的加入有望重塑其底层架构。 性能出众兼具降本优势,每年 最高 可省 6 亿美金 作为全球参数规模 最大 的开源模型,Kimi K3 在编程等多项 权威 评测中展现出了媲美 顶级 模型的卓越性能。微软内部测算显示,切换至该模型后单个Token的推理成本 最高 可降低60%,每年将为公司节省约6. 02 亿美元的开支。 巨额收益碰撞政治风险,政策红线成 最大 隐忧 然而,这项极具商业诱惑力的决策正面临着严峻的外部政治考量与政策风险。当前美国政府正计划进一步限制本土企业使用中国AI模型,甚至可能出台针对性的禁用禁令。 如果在旗舰产品中深度整合中国开源技术,微软极有可能招致白宫方面的强烈不满与审查。面对巨大的经济利益与复杂的政治局势,微软目前依然处于谨慎权衡与抉择的阶段。
马斯克把Grok塞进Excel:选中一片数据就能问涨跌原因,图表直接插进表格
马斯克旗下的xAI,把自家大模型Grok直接装进了微软Office的心脏地带。据多家财经媒体 7 月 21 日消息,xAI为微软Excel推出了一款名为Grok For Excel的免费Microsoft365 插件,目前已上线Microsoft Marketplace,同时兼容Word与PowerPoint。这意味着Grok不再只活在聊天框里,而是成了办公套件里随手可调用的数据分析员。 这款插件的使用逻辑极其贴近真实办公场景:用户在Excel里选中一片数据区域,就能直接向Grok发问,询问数据的变动情况、背后的原因以及其中的亮点,而Grok的回答会明确引用对应的数据单元格,不是凭空给结论。它还能理解公式语法,完成平均值计算、排序、填充等常规编辑操作,生成的图表则可以一键插入工作表。换句话说,过去要写函数、拖公式、手动画图的活儿,现在对着数据说句话就能推进。 更关键的是,Grok并不只盯着表格里那一小块被选中的数据。借助连接器,它能从电子邮件、SharePoint或Google Drive中提取上下文信息,把散落在各处的资料拼进当前分析。这一能力让Excel里的问答不再是孤岛,而是能结合邮件往来、团队文档和外部文件做出更完整的判断。当Grok以免费插件的姿态嵌入Word、PowerPoint和Excel三件套,办公软件与对话式AI的边界,又被磨掉了一层。
经典版 Outlook 迎来重大更新:微软宣布今年内引入 AI 自动起草邮件功能
微软正在积极推进旗下办公软件的智能升级。根据 最新 规划,微软计划在年底前向 Windows 10 和 Windows 11 平台上的经典版 Outlook 用户推送 Copilot 功能更新。 AI 赋能邮件撰写 这次更新最核心的亮点是加入了 AI 起草电子邮件功能。持有相关许可证的用户届时可以直接在写信框中一键唤醒 AI,让系统协助撰写新邮件或润色已有草稿。 微软此举旨在让老用户也能享受智能化带来的便捷体验。不过也有分析指出,这一变动可能打破部分传统用户的习惯,甚至增加日常使用的复杂性。 推动软件升级迭代 其实微软一直以来都在引导用户向新版 Outlook 迁移。团队正不断丰富新版应用的功能生态,试图以此吸引更多用户主动完成版本过渡。 尽管开发重心早已偏向新版,微软依然选择为经典版追加 AI 功能。这一策略能否兼顾老用户的习惯与智能化趋势,仍有待市场后续检验。
谷歌升级Gemini Enterprise:优化界面并推进Workspace连接器重构
谷歌正在推进企业级AI助手Gemini Enterprise的新一轮更新,平台主提示栏已采用与消费者版Gemini应用一致的炫彩视觉设计,进一步统一企业与个人用户的产品体验。这一变化也体现出谷歌希望让企业AI助手与数亿用户使用的Gemini生态保持一致的发展方向。 此次更新中,更受关注的是Google Workspace连接器升级。部分用户收到通知称,连接器更新后可能需要重新授权才能继续使用。虽然谷歌尚未公布具体技术细节,但这一调整可能涉及权限扩展或底层架构优化。 近年来,Gemini Enterprise持续扩展企业数据连接能力,目前已支持Slack、Microsoft Teams、Notion、Linear、Jira、ServiceNow等多种办公工具,并逐步增加创建页面、更新工单等操作能力。连接器架构的优化,将直接影响AI助手读取企业数据、执行任务以及调用外部服务的稳定性。 此外,谷歌在5月I/O大会期间公布的智能代理功能Gemini Spark,目前已出现在Gemini Enterprise功能设置中,但仍处于隐藏状态。谷歌表示,Spark未来将向企业客户开放,并可通过SharePoint、OneDrive和ServiceNow等连接器执行后台任务。 业内认为,此次Gemini Enterprise更新并非简单的界面调整,而是谷歌为企业级AI代理能力扩展进行的基础设施建设。随着企业AI助手逐渐从信息查询走向任务执行,数据连接、安全权限和系统兼容能力将成为决定产品落地效果的关键因素。
OmniRoute
永不停歇地编码。免费 MIT 许可的 AI 网关:一个端点,268+ 提供商(50+ 免费),500+ 模型——Claude、GPT、Gemini、Kimi K3、GLM、DeepSeek。兼容 Claude Code、Codex、Cursor、Cline 和 Copilot。配额感知自动回退,RTK+Caveman 压缩可节省 15-95% tokens,支持 MCP/A2A、多模态、桌面/PWA。由 500+ 贡献者打造。
Ontology-Playground
免费、开源的 Web 应用,用于学习本体和 Microsoft Fabric IQ。浏览预构建本体目录,可视化设计自己的本体,导出为 RDF/XML,并分享交互式图表。零后端,完全静态。
围观WAIC模型「读心术」!现场火火火火火
关注前沿科技 2026-07-19 18:18 北京 一个对抗LLM结构性缺陷的模型架构 允中 发自 凹非寺 量子位 | 公众号 QbitAI 如果你走进2026 WAIC的现场,最直观的感受可能只有一个“卷”字。 1100多家企业、10万平米的展区,目之所及,几乎每家展台的屏幕上都闪烁着 Agent 这个 词。 但“智能体”喊得越响,行业的焦虑就越明显:算力内卷到头了,Agent到底怎么进企业、怎么帮核心业务赚钱? 在一片技术喧嚣中,一个新解法吸引了我们的注意—— 主观世界模型(Subjective World Model,SWM)。 △ “主观世界模型”登上央视新闻直播间 为了搞懂这个新架构,我们顺着人流挤进了 特赞科技 的展位。 在硬核的技术拆解面前,我们不得不承认,过去指望靠大模型(LLM)去猜测 消费者心思 的路子,可能从一开始就走错了。 因为, LLM从根本上不适合用来建模人的决策。 架构设计的核心判断 SWM的设计起点是一个认知心理学上的已知事实:人的“自我报告偏好”和“真实决策权重”之间存在系统性偏差,这个偏差是可测量的,也是可建模的。 基于这个判断,SWM选择了四层异构数据协同训练的路径—— 每一层针对不同类型的“理解人”子任务,使用不同数据源、不同建模目标、不同验证机制,推理时四层联合打分。 Layer 1:表达层Expression Layer 数据: 数十亿条社交平台原生语料 目标: 构建语言风格向量 → demographic/psychographic特征的高维映射 技术本质: 这是一个有监督的representation learning任务。输入是用户的历史文本序列,监督信号来自用户画像标注 (年龄/地域/职业/消费层级等)。训练收敛后,相同demographic cluster的用户,其语言表征在embedding空间中会自然聚集——这个embedding作为后续层的persona anchor。 表达层本身不是壁垒——社交数据可以规模化采集。 它的价值在于为Story Layer的稀疏深访数据提供“扩散基底”:通过persona anchor将深访persona的特征迁移到更大范围的社交用户群。 Layer 2:叙事层Story Layer 数据: 数万小时一对一深度访谈语料,单次访谈1-2h,产生5k-20k字非结构化文本 目标: 建模行为动机的时序因果图 (causal graph of purchase motivation) 技术本质: 这是一个序列因果建模任务,而非分类或生成任务。训练目标不是预测“下一句话是什么”,而是识别访谈叙述中的trigger event → consideration formation → decision point → post-purchase rationalization的完整因果链,并将其结构化为有向因果图。 为什么合成数据在这一层完全失效: 真实受访者的叙述具有跨情境的因果一致性 (causal consistency) ——同一个个体在描述不同购买场景时,其核心动机结构会以不同表现形式反复出现,形成可识别的“动机签名”。 LLM生成的模拟访谈数据没有这个属性,原因是LLM在每个token步骤独立预测,没有维护跨情境一致的内在状态。 合成语料在Cognition Layer和Behavior Layer的交叉验证中会系统性失败——相当于一个内置的抗合成机制。 Layer 3:认知层Cognition Layer 数据: 行为判断问卷、Schwartz Value Survey、Big Five Inventory等标准化量表 目标: 个体的价值权重向量 (value weight vector) 和风险偏好系数 技术本质: 这一层的核心是建模stated preference和revealed preference之间的gap——即“消费者说他在意什么”和“消费者实际决策时权衡什么”之间的差值函数。训练目标是在Story Layer提供的行为叙述和量表测量结果之间建立校正映射,输出个体的真实价值权重向量。 Layer 4:行为层Behavior Layer 数据: 经济博弈实验数据 (ultimatum game / public goods game / trust game) + 真实交易记录 目标: 行为经济学参数估计——loss aversion coefficient λ、hyperbolic temporal discounting rate δ、social norm sensitivity γ 技术本质: 基于prospect theory的参数化个体建模。这些参数在跨情境行为预测中起关键作用:当模型遇到out-of-distribution场景 (历史数据中没有见过的产品类别或购买情境),需要通过这些基础参数外推反应,而非依赖历史pattern匹配。这是SWM能在新产品研究中有效工作的底层原因。 四层协同推理:如何输出AI Persona 四层训练完成后,SWM对每个目标persona维护一组联合状态:表达层的语言风格嵌入 + 叙事层的动机因果图 + 认知层的价值权重向量 + 行为层的经济学参数。 推理时,给定一个新的研究prompt (如“你对这款新包装设计有什么看法”),四层联合打分:表达层决定语言风格和情绪色彩,叙事层调用相似情境下的动机结构,认知层校正自我报告偏差,行为层注入跨情境稳定的行为倾向参数。 输出的AI Persona在连续追问下维持一致的内在状态——这是和LLM直接生成persona的本质区别: LLM的persona是stateless的,每次回答独立生成; SWM的persona是stateful的,有一个跨prompt持续存在的内在状态。 量化结果: 行为模拟准确率85% (对比真人深访基准)。30万+AI Persona (社交数据扩散),1万+高精度AI Persona (深访语料直接训练),交付<30分钟。 注:atypica是基于主观世界模型构建的智能体,Gamelab是atypica为了确保AI模拟准确性的核心Evals手段,通过让真人和AI Persona完成相同的经济学行为实验,对比两者的决策数据,以此量化校准AI Persona对真人的模拟准确度,目标是让AI Persona和真人的数据无限接近。 如何从理解侧到执行侧? SWM是“理解消费者”的模型,特赞的团队更进一步,研发了 GEA(Generative Enterprise Agent)企业级智能体架构 ——是“执行面向消费者任务”的架构。 两者在特赞的技术栈中构成理解-执行的完整链路。 GEA的编排层由特赞自研发散推理模型 (Creative Reasoning Model) 驱动——这是 中国首个备案的发散推理领域的大模型,核心设计是在收敛前先穷尽发散可能性,而非直接走beam search到最优解。 这个特性在创意内容生成、方案设计等需要探索解空间的任务上有显著优势。 执行层调用400+模块化Agent Skill,单次任务可协调30+基础模型。 Context System作为企业知识的持久化存储层,将品牌DNA、历史洞察、产品库、素材库等结构化为智能体可检索的上下文,解决多轮任务中的上下文漂移问题。 目前,其已在内容营销、洞察研究、产品创新、设计创作等业务场景跑通并实现大规模部署,月均Token部署量超100亿,覆盖全球50+国家和地区。 △ 特赞的展位,H1-C135,观众们在了解主观世界模型 企业AI下半场,一个技术判断 SWM的竞争壁垒不在于架构设计的复杂度——四层协同建模的框架本身是可以被复制的。 壁垒在于 Story Layer的数据积累:十年间真实深访语料的堆叠,加上内置的抗合成机制,使这个数据壁垒具备了自我保护能力。 当合成数据路线在Cognition/Behavior交叉验证中系统性失败,后发竞争者就只有一条路:从头开始做真实深访,追赶十年的数据积累。 这个差距不能用算力缩短。 过去两年,企业AI的主要竞争逻辑是“接入”——接哪个大模型、能不能快速上线一个Copilot。 这个阶段基本过去了。大模型API已经是商品,工程接入能力不再形成壁垒。 下半场真正拉开差距的,是 对业务场景
需要一个可以创建和更新睡眠日志的平台
After massive failures by Copilot and Claude, I need an AI platform that is free and can save an ongoing log. I have had two strokes and a heart attack and am in a wheelchair and genuinely unable to work. I have a phone hearing with an Administrative Law Judge for SSDI on September 7 and I need to create a sleep log including naps that I can update on a regular basis. Can anyone suggest an AI that can facilitate such a request? submitted by /u/Stroke_of [link] [comments]
港科大新发现:MoE路由很脆弱!重复token输入阻塞负载均衡 | ICML'26
新智元 2026-07-18 18:26 北京 新智元报道 MoE大模型正在成为高效推理的主流路线。 它把一个大模型拆成很多「专家」,每个token只激活其中一小部分。这样一来,模型总参数可以很大,但每次推理的实际计算量不会爆炸。对服务商来说,这几乎是一个甜蜜的工程答案:更大模型,更低成本,更高吞吐。 但这篇来自ICML 2026的工作发现,MoE模型最重要的组件之一——专家路由里,藏着一个新的系统级风险。 来自港科大的研究团队提出了RepetitionCurse,这是一种针对MoE大模型服务的黑盒压力测试方法。 它不需要模型权重,不需要梯度,也不需要知道后端专家如何部署,只利用高度重复的输入模式,就能诱导专家路由把大量token路由到同一小批专家上。 论文链接: 结果某些GPU被打成straggler,其他GPU空等同步,最终拖慢time-to-first-token(TTFT),也就是用户看到第一个token的时间。 实验显示,在常见8-GPU EP部署上,RepetitionCurse可让MoE模型的TTFT增加20%到148%。 攻击原理 MoE的router,本质上像一个分诊台。 每个token来了之后,router会判断它该交给哪些专家处理。 正常文本有丰富语义,token的隐藏表示比较分散,router通常会把它们分给不同专家,这也是MoE模型训练时非常注重的专家负载均衡。 而RepetitionCurse利用的是另一个极端:当输入里出现高度重复的token模式时,连续token的表示会变得非常相似。 对router来说,这些token像一群「长得几乎一样的客人」,于是被反复送进同一批专家。 正常输入下,3个GPU负载接近33%/34%/33%;RepetitionCurse输入下,负载可能变成98%/1%/1%,一个GPU变成straggler,其他GPU必须停下等待。 问题从这里开始变得系统化。 在实际部署中,MoE模型通常使用Expert Parallelism,也就是把不同的完整专家放到不同GPU上。正常情况下,这能分摊计算压力;但如果大量token都被路由到同一GPU上的专家,那张GPU就会成为瓶颈,而其他GPU即使没干多少活,也必须等它完成之后才能继续同步,导致系统出现 单点拥堵。 Mixtral-8x7B上,正常输入的专家负载分布较均匀;RepetitionCurse 会让大量token在多个层上集中到少数专家,热力图出现明显高亮块。 论文把这种现象称为routing collapse。攻击输入让router的选择从「分散派单」变成「固定派单」,最终把MoE的并行优势反过来变成系统短板。研究团队指出,RepetitionCurse可以在黑盒场景下工作,不依赖模型参数,也不依赖后端routing细节。它的目标也不是控制输出内容,而是拖慢prefill阶段,从而放大TTFT。 过去MoE模型的安全问题通常只在模型输出层被考虑,例如「让模型生成很长」「让模型无限思考」「让Agent调很多工具」,研究人员指出它们在服务系统层也可能有可被利用的安全漏洞,即便输出只生成1个token,也可能通过破坏每个输入token的计算效率,让服务变慢。 攻击效果 对用户来说,大模型卡不卡,最直观的指标就是TTFT。 TTFT指从请求到达,到第一个token返回之间的时间。它是聊天机器人、Copilot、搜索问答、Agent服务里非常关键的体验指标。用户不一定知道后端用了多少GPU,但一定能感觉到「怎么还不开始说话」。 论文用一个简单指标衡量延迟放大: 如果这个值是2.48,就意味着攻击输入下,第一个token的返回时间是正常输入的2.48倍。 研究团队在vLLM上部署目标模型,使用ShareGPT中2048条用户请求进行测试。结果很直接:EP size越大,RepetitionCurse越容易把并行系统「拧成单线程」。 在Mixtral系列上,8-GPU部署下TTFT最高增加148%。在更稀疏的Qwen3-30B-A3B系列上,当EP size扩到32时,TTFT最高增加115%。 在常见8-GPU设置下,RepetitionCurse还会把原本P99的SLA保证拉低到P98.6到P86.4,意味着服务违约率从1%上升到最高13.6%。 不同MoE模型在不同EP size下的TTFT LAR。 更麻烦的是,LLM服务不是一个请求一个请求孤立执行的。为了吞吐,服务系统会把多个请求打包成batch。这意味着攻击请求可以「搭车」影响正常请求。 论文分析了两种场景。 第一种是mixed-user batches:攻击请求和正常用户请求进入同一个batch。此时,正常用户明明没有发送异常输入,也会一起等待被拖慢的batch完成。 第二种是attack-only batches:某段时间里只有攻击请求进入系统。即便正常用户没有和攻击请求同batch,攻击请求也会占用prefill能力,导致后续正常请求排队更久。 攻击请求不仅增加同batch用户的TTFT,还会让后续batch的排队时间上升,影响沿服务队列传播。 RepetitionCurse不需要让后端GPU全部满载。它只需要制造一个足够慢的straggler,就能让同步机制把其他GPU一起拖住
从Token Capital到企业认知主权:别把大脑交给大模型公司!
新智元 2026-07-17 21:03 北京 新智元报道 最近,微软CEO Satya Nadella和Palantir CEO Alex Karp几乎在同一时间,从不同角度提出了一个越来越尖锐的问题: 当人工智能开始深度参与企业的思考、决策和执行之后,企业究竟是在获得一种新的生产力,还是在逐渐把自己的知识、经验、判断和竞争优势交给外部模型公司? 这并不是一个简单的数据安全问题,也不仅是一个模型成本问题。它真正触及的是企业在AI时代最核心的权力结构:谁拥有企业的认知资产,谁控制企业的学习闭环,谁能够从每一次业务交互中持续进化,以及最终谁拥有企业的大脑。 从这个角度看,纳德拉近期的两篇文章和Karp的CNBC访谈非常重要。它们标志着全球顶级科技企业的讨论重点,正在从「模型能力有多强」,转向「企业如何避免失去自己的认知主权」。 佟佳睿(Richard Jiarui Tong)博士最近发布了一篇评论,将纳德拉的两篇长文、Karp的CNBC 访谈,与他本人更早提出的企业认知系统和认知主权框架放在同一条思想演进线上。 值得注意的是,纳德拉等公开提出的问题,正是佟佳睿博士更早在企业认知系统、ECS、NSEAP和KSTAR体系中已经开始系统设计和工程化解决的问题。 佟佳睿(Richard Jiarui Tong)博士担任IEEE人工智能标准委员会(AISC)主席,并领导IEEE P3394大语言模型智能体接口标准工作组, 在AI标准化与产业实践方面具有重要影响力。 纳德拉的第一层判断 2026年6月14日,美国东部时间上午11:33,纳德拉在X上发表长文 《A frontier without an ecosystem is not stable》。对应北京时间为2026年6月14日晚上11:33。 推文链接: 这篇文章中最重要的概念,是他提出的 Token Capital。 传统企业积累的是Human Capital,也就是员工、专家、组织经验、专业判断和管理能力。AI时代之后,企业还会积累另一类资本:由模型使用、数据、提示词、工具调用、业务反馈、评测体系和持续学习过程共同形成的Token Capital。 纳德拉强调,真正有价值的AI能力,并不是简单调用一个外部模型。任何企业都可以买到相似的模型,也都可以使用相似的API。 企业真正的差异化来自于,它是否能够围绕自己的业务建立一个学习闭环,并把每一次模型使用转化为组织自身的能力积累。 换句话说,模型本身并不是壁垒。 真正的壁垒是企业是否能够把自己的业务知识、专业判断、执行过程和反馈结果,持续沉淀为一种可以重复使用、持续优化和独立拥有的能力。 纳德拉实际上承认了一个非常关键的事实: 企业不能只拥有AI的使用权,企业必须拥有AI使用过程中形成的学习资产。 这已经比早期「购买大模型、部署Copilot、提高员工效率」的叙事向前走了一大步。 但是,Token Capital仍然只是一个资本层面的概念。 它指出企业需要积累AI能力,却还没有完全回答这些能力到底以什么形式存在、如何被管理、如何被验证、如何被更新,以及如何防止它们依附于某一个模型供应商。 而这正是佟博士提出企业认知系统的原因。 纳德拉的第二层判断 2026年7月12日,美国东部时间上午11:09,纳德拉又在 X 上发表了关于 Reverse Information Paradox,反向信息悖论 的论述。对应北京时间为2026年7月12日晚上11:09。 推文链接: 传统的Arrow Information Paradox指出:信息卖方如果不披露信息,买方无法判断价值;但如果先披露,买方可能已经免费获得了信息,因此不再需要购买。 纳德拉认为,AI时代出现了相反的情况。 企业为了获得模型服务,必须首先把自己的问题、上下文、数据、工作流程和判断标准暴露给模型。模型公司不再只是向企业出售知识,反而能够通过企业的使用过程,理解企业是如何思考、如何工作和如何创造价值的。 也就是说,企业不仅在支付 Token 费用,还在持续向模型系统贡献: 真实的业务问题; 高价值行业语境; 专家的判断方式; 任务分解路径; 决策偏好; 成功与失败的反馈; 结果评价标准; 以及企业内部尚未显性化的知识。 这些信息单独看可能只是一次提示词、一次模型调用或一次用户纠正,但积累起来,它们构成的并不是普通数据,而是一张企业的认知地图。 模型供应商可能逐渐看到: 企业关注什么问题,如何定义目标,如何评价答案,哪些建议会被接受,哪些会被拒绝,以及企业真正依赖的价值判断是什么。 这就是反向信息悖论的本质: 企业以为自己只是在购买智能,实际上也可能在向外部系统持续输出自身的智能。 企业原本最有价值的部分,并不一定存在于某一张数据库表里,而可能存在于员工如何解决问题、主管如何做判断、专家如何平衡风险,以及组织如何从结果中学习。 AI 系统恰恰能够从这些交互中提取这些隐性的认知资产。 Karp的愤怒 2026年7月1日,Palantir CEO Alex Karp 在 CNBC《Squawk Box》节目中接受采访。CNBC 随后在同日发布了访谈视频。 如果说纳德拉的表达仍然带有平台生态和产业结构的抽象性,那么 Karp 的表述则更加直接,甚至带有明显的愤怒。 Karp认为,当前大模型产业存在两个严重问题。 第一个问题,是企业正在支付大量Token成本,却没有获得相应的业务价值。 第二个问题更严重:企业可能正在把自己的数据、流程、业务逻辑和竞争优势交给模型公司。 他把企业区别于竞争对手的核心能力称为 Alpha。 Alpha不只是客户名单、财务数据或技术专利。它还包括企业知道如何运营、如何做决策、如何配置资源、如何识别风险,以及如何在复杂环境中实现结果的独特能力。 Karp要求每一家使用 AI 的企业都必须能够回答几个问题: 谁拥有这些数据? 数据被缓存在什么地方? 提示词是否受到保护? 交互产生的知识是否会被转移给供应商? 企业是否正在被模型公司理解、抽象,甚至复制? Axios后来将这一问题总结为:AI正在成为企业思考、销售和决策的操作系统,因此企业必须像保护自己的专有大脑一样保护 AI 系统。Axios 还将「Alpha」定义为企业区别于市场的知识,将「主权 AI」定义为企业对模型和连接专有知识的应用层保持控制。
BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、...
BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、896 选 16 的 Stable LatentMoE,是全球首个 3 万亿级开源模型。它用 KDA 线性注意力加 Attention Residuals 把上下文撑到 100 万 token,在内核优化、从零写编译器、芯片设计等长程 Agent 任务上接近 Fable-5,但仍落后最强闭源模型,完整权重将于 7 月 27 日前开源。 来源:月之暗面 Kimi [2] ★ 精讲|Agent 跌跌撞撞进入世界|2026 Q2 AI 趋势总结 腾讯企鹅智库的 Q2 复盘把过去三个月串成一条线:通用 Agent 夺走软件入口后,企业烧 Token 的 Tokenmaxxing 运动很快撞上复核瓶颈和成本墙。Multi-Agent、自进化 AI 和 CPU 重回算力中心在补这些缺口,而就业、安全、信息污染和认知缴械开始浮上水面。 来源:腾讯科技 [3] ★ 精讲|Cursor 如何知道 Claude Fable 5 已准备好应对最难的 1% 问题 | Claude by Anthropic Cursor 的模型评测负责人讲他们怎么判断 Fable 5 够格上岗:自建 CursorBench 里它拿到 72.9% 的新高,更关键的是登月模拟里它先入轨采遥测、再落地,体现出超越局部推理的全局规划能力,适合那些连目标在哪都不清楚的难题。 来源:Claude Blog [4] Garry Tan:如何打造 AI 原生公司 [视频] Garry Tan 将 AI 原生公司定义为:把可重复的智能体工作沉淀为持续维护的技能,并以经过治理的公司记忆不断累积竞争优势的组织。 来源:AI Engineer [5] 代理安全差距:54% 的企业已经发生了 AI 代理安全事件,且大多数仍允许代理共享凭据 VentureBeat Pulse Research 的调查发现,超过一半的企业已经经历了 AI 代理安全事件或险情,但大多数仍允许代理共享凭据,并依赖供应商原生控制而非专用的身份和隔离控制。 来源:VentureBeat [6] LangChain Deep Agents:构建长时程 AI 应用的生产级框架 [视频] LangChain 的维护者将 Deep Agents 定义为一套面向生产环境的智能体运行框架:它在普通工具调用循环之上补足规划、委派、外部化上下文、沙箱执行与可观测性,以支撑长时程 AI 任务。 来源:LangChain [7] 世界模型为何可能提升 AI 的样本效率 [视频] 一场 Y Combinator 对谈解释了世界模型如何让 AI 智能体在机器人、游戏和自动驾驶等场景中先预测、模拟与规划,再采取行动,从而以更少数据学习。 来源:Y Combinator [8] 高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践 阿里大淘宝技术团队分享其基于约定驱动与 AI 编排架构,构建自动化评测体系将 Agent Skill 可用性从主观判断转变为可量化工程闭环的实践,重点剖析了评测集生成、双引擎架构、金标设计陷阱及飞轮挑战。 来源:大淘宝技术 [9] 马斯克连夜开源 Grok Build,但 84 万行代码里还留着上传用户整个代码库的痕迹 本文详细报道了马斯克旗下 xAI 开源 Grok Build 编程智能体的前因后果,并深度解析了其 84 万行 Rust 代码库的构成、此前被曝光的整库上传隐私丑闻的技术细节,以及开源后仍残留的上传代码痕迹。 来源:InfoQ 中文 [10] WAIC 今日启幕,我们提前两天完整拆解 Agent 经济落地全路径 本文完整拆解了 Agent 经济从 Copilot 到 Long-running Agent 的落地全路径,覆盖商业模式、基础设施、垂直场景、出海实战等关键议题,并给出组织变革与信任设计的核心框架。 来源:非凡产研 --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
RT BestBlogs: BestBlogs Daily · 07-17 # Nemotron 3 Embed / Kimi K3 / Inkling / Fable / Bun [1] ★ Deep Dive · NVIDIA Nemotron 3 Embed Ranks #1 Overa...
RT BestBlogs BestBlogs Daily · 07-17 # Nemotron 3 Embed / Kimi K3 / Inkling / Fable / Bun [1] ★ Deep Dive · NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval NVIDIA open-sources Nemotron 3 Embed, a retrieval family whose 8B model ranks #1 on RTEB (78.5%) with a 32k context and multilingual plus code retrieval, plus a 1B and a Blackwell NVFP4 build that doubles throughput at 99%+ of BF16 accuracy. The payoff is agentic: better retrieval surfaces evidence earlier, so agents loop and reason less, burning fewer downstream tokens — the foundation under RAG and agent memory. Source: Hugging Face - Blog [2] ★ Deep Dive · How to Make Your AI Agent's Actions Reliable (No Code) Calling an API is the easy half of an agent; the hard part is firing it only when it should, and carrying the right value forward. This no-code guide argues a prompt is not a boundary — the model's choice to act is a probabilistic judgment that can be coaxed or prompt-injected. The fix splits each action into model judgment versus server guarantees: a 'Run only when' gate checked before any request, and 'Save to memory' to carry one value forward, so the chat cannot talk past it. Source: Hacker News - Newest: "AI Agent" [3] ★ Deep Dive · The Pulse: What can we learn from Bun's rapid Rust rewrite with AI? Jarred Sumner used Anthropic's Fable to rewrite Bun from Zig to Rust — 535K lines, 11 days, $165K — turning a year-long migration into a sprint. The method wasn't 'rewrite this, zero mistakes': 3 hours of prep yielded a 600-line porting guide, a trial run was adversarially reviewed, then work split across 64 parallel agents. The takeaway: a thoroughly-tested project plus disciplined orchestration makes an unthinkable rewrite feasible — not AI doing it solo. Source: The Pragmatic Engineer [4] Welcome Inkling by Thinking Machines Inkling is a large open multimodal model (~1T params, 1M context) that natively accepts image, text, and audio inputs, with agentic capabilities and day-0 support in major inference engines. Source: Hugging Face - Blog [5] Computer-Use 2.0: Agents Just Got Multi-Cursor — Francesco Bonacci, Cua [Video] A conference talk that maps computer-use agents from foreground screenshot loops to background execution, then connects reliable evaluation and sandbox infrastructure to scalable agent training. Source: AI Engineer [6] Forward Deployed Engineering at Cursor — Pauline Brunet [Video] Cursor's forward deployment leader offers a practical framework for deciding where FDE belongs, how to scope it around measurable change, and how to build a team that improves both customer adoption and the product roadmap. Source: AI Engineer [7] Kimi K3, and what we can still learn from the pelican benchmark Simon Willison reviews the newly released Kimi K3 model from Moonshot AI, runs his signature 'pelican riding a bicycle' test, and reflects on the test's evolving utility as a quick model evaluation tool. Source: Simon Willison's Weblog [8] The Archaeologist’s Copilot This article presents a systematic approach to using AI as an 'archaeologist' rather than a 'tourist' when dealing with legacy codebases, demonstrating through a real case study how to analyze, contain, and gradually modernize a 2005-era Java project without breaking its fragile functionality. Source: Martin Fowler [9] Danau5tin/ai-trains-ai: RL-training an AI agent to RL-train AI agents An RL agent learns to design AI training jobs, improving itself and generalizing to new tasks. Source: Hacker News [10] WTF Is the Context Layer? The Missing Infrastructure for Production Agents — Prukalpa Sankar [Video] Atlan founder Prukalpa Sankar explains why production AI agents need a shared, governed context layer that turns a company’s facts, expertise, norms, and feedback into reusable machine-usable knowledge. Source: AI Engineer --- · Discover high-quality content that truly fits you BestBlogs is an AI-powered personal reading assistant that helps you discover high-quality content that truly fits you. Follow the sources and topics you care about, and get a daily brief that fits you better every day. Try it and follow us. Read online: BestBlogs:
RT DAIR.AI: NEW research from Microsoft. It's on scaling distribution-matching RL to large reasoning models. Short summary: GFlowNet-style RL is appea...
RT DAIR.AI NEW research from Microsoft. It's on scaling distribution-matching RL to large reasoning models. Short summary: GFlowNet-style RL is appealing because it matches reward distributions and encourages diverse reasoning paths instead of collapsing to a single dominant mode. The trouble is scale. As model size, rollout horizon, and reward noise grow together, the learned prompt-conditional partition function becomes a source of gradient instability and engineering overhead. GFlowRL removes that component. The learned partition function, previously treated as essential, is replaced by an in-batch Monte Carlo estimate computed from the rollout group already produced during training. Paper: Learn to build effective AI agents in our academy: