KNOWLEDGE INDEX · 主题
政策与治理
Policy
63条关联资讯
也可检索监管 · 治理 · safety · governance
CHRONOLOGICAL RECORD
按时间查看
OpenAI 基础设施预算增至7500亿美元,首笔200亿落子佐治亚州数据中心
OpenAI 于2026年7月22日宣布,计划在2030年前投入7500亿美元用于 AI 基础设施建设,该预算较今年早些时候的预估大幅增加约25%。在旗舰数据中心项目“星门”(Stargate)推进陷入停滞的背景下,此举标志着 OpenAI 正在通过更为激进的资本开支重新锁定长期算力优势。 作为这一庞大投资计划的首个落地项目,OpenAI 拟耗资200亿美元在佐治亚州萨凡纳西北部建设占地1400英亩的“山茶花计划”(Project Camellia)数据中心园区。该园区已与佐治亚电力公司达成合作,预计于2028年至2032年间陆续获取至少3.2吉瓦的电力供应,并由 OpenAI 承担全部新建基础设施和电力服务费用。为降低对当地电网的冲击,OpenAI 承诺在用电高峰期减少 最高 1吉瓦的负荷,同时项目获得了埃芬汉县提供的15年50% 房产税减免。 尽管项目用电规模庞大,但双方均未披露具体的清洁能源过渡方案。监管文件显示,佐治亚电力公司拟新增的近9.9吉瓦发电容量中,超过半数(约5.8吉瓦)将依赖天然气,其余由光伏与储能补充,这引发了市场对算力扩张加剧化石燃料依赖及碳排放问题的担忧。值得注意的是,OpenAI 近期招募了曾主导 xAI 孟菲斯 Colossus 数据中心建设的高管 Brett Mayo 负责数据中心业务,或预示着首批 GPU 部署节点将早于2028年落地。 在生成式 AI 迈入高阶模型训练与推理规模化应用的关键期,OpenAI 巨额基础设施资金的落地,不仅凸显了头部厂商在算力与电力资源上的深度博弈,也反映出超大规模 AI 数据中心建设在重塑区域电网格局与推动能源结构转型上面临的现实挑战。
BestBlogs早报指出软件工厂的可验证判断成关键,OpenAI Presence实现企业Agent可控部署。
本期还涉及NVIDIA Rubin架构、智能体授权、LangGraph图工程和推理加速实践。
太空数据砸进AI!马斯克掏出SpaceX家底, 2 万亿参数Grok大模型即刻炼成
为了打造更强的人工智能,马斯克再次展现了跨界整合资源的手腕。他近日公开宣布,SpaceX自 2002 年成立以来积累的 顶尖 工程数据,将正式用于训练下一代Grok大模型。 剔除敏感信息保障合规 这次参与训练的数据规模空前巨大,涵盖了制造工艺、材料科学以及星链硬件设计等多个核心领域。不过受限于美国出口管制法规,火箭发动机与制导控制等国防敏感技术已被严格排除在外。 据了解,即将问世的新模型参数量达到了惊人的两万亿,规模比刚刚推出的Grok 4. 5 翻了一番。这一庞大的数据工程预计将在本周内完成最终训练,并展现出超越以往的推理能力。 多方协同构建数据帝国 这种跨界联动完全符合马斯克一贯的数据协同战略。在此之前,特斯拉提供了真实驾驶与制造经验,社交平台则贡献了海量的日常对话语料。 如今加上航天工程数据的补充,Grok大模型将拥有极其独特的能力优势。从汽车到社交再到火箭,马斯克正一步步将麾下帝国的核心资产转化为AI领域的护城河。
三星拟掷 10 亿欧元押注Mistral:欧洲AI独立的底气,正被资本重新定价
一笔可能改写欧洲AI版图的注资,正在谈判桌上悄然成形。 7 月 22 日,据英国《金融时报》早些时候报道,三星正考虑进一步追加投资法国人工智能初创企业Mistral AI。这不是三星 第一 次向这家公司下注——其风险投资部门此前已经给予Mistral AI资金支持,这一轮若落地,将是双方关系的又一次纵深绑定。 消息人士给出的数字相当具体。Mistral AI仍计划以 200 亿欧元的估值开启D轮融资,而三星可能会在本轮投入 10 亿欧元,按当下汇率约合77. 28 亿元人民币。对一家成立仅数年的欧洲初创公司而言,单笔十亿欧元的意向,本身就是市场对其身价的一次重量级背书。 这笔交易的重量,远不止于账面的金额。在美国政府近期一连串监管措施落地之后,作为代表性的非中美开源人工智能企业,Mistral AI对于欧洲乃至更广泛地区的人工智能独立性,重要性被进一步凸显出来。当全球AI能力日益被少数中美巨头收拢,一家根植欧洲、坚持开放权重路线的公司,成了许多地区守住技术主权的关键支点,资本对它下注,买的其实是一张区域自主的保单。 除了三星,这轮融资的棋局里还坐着另一位玩家。据称,瑞典投资机构EQT旗下的Scaleup Europe基金也在洽谈参与Mistral AI的D轮融资。多方资本的围拢,意味着这家法国公司的独立叙事,正在被越来越多人用真金白银重新定价。
AI应用性别鸿沟扩大:研究称女性生成式AI使用率低22%
近日,演员瑞茜·威瑟斯彭在Instagram发布视频,呼吁更多女性学习和使用人工智能,引发外界对AI领域性别差距问题的关注。她表示,女性在人工智能应用方面参与不足,希望推动更多女性了解这一技术。不过,该视频也引发部分网友讨论,认为她对AI带来的环境影响、数据中心问题以及算法偏见等风险关注不足。 研究显示,AI领域确实存在明显的性别使用差距。哈佛商学院今年4月发布的一项荟萃分析显示,基于25个国家、超过14.3万名参与者的数据,女性使用生成式人工智能的可能性比男性低22%。德勤2024年研究也发现,随着年龄增长,AI采用率下降趋势更加明显,其中45岁以上群体的性别差距尤为突出。 职场层面的差距同样存在。Randstad报告显示,人工智能技术岗位中男性占比71%,女性仅占29%。男性获得企业AI培训的比例为35%,女性为27%;在生成式AI技能掌握方面,男性比例达到69%,女性仅31%。 专家认为,女性较低的AI参与度与风险认知、科技行业代表性不足以及时间资源分配有关。研究显示,女性通常承担更多家庭照护责任,缺少尝试新技术、参与培训和持续实践的时间。 不过,AI时代的机会并不局限于核心技术岗位。人工智能伦理治理、医疗教育应用、产品运营和数据分析等方向,也为女性参与AI产业提供了更多入口。专家建议,企业应将AI培训纳入工作体系,而非作为员工额外负担,通过灵活学习机制、社区支持和实际应用场景,帮助更多女性建立AI使用能力。 随着人工智能逐渐成为工作和生活基础工具,缩小性别差距不仅关系到技术公平,也可能影响未来人才结构和产业创新能力。推动更广泛的AI教育与应用,将成为人工智能生态发展的重要课题。
颠覆传统模式!美国将改革 2000 亿美元科研预算,重心转向个体与AI
为了加快技术升级并应对全球竞争,美国政府计划对联邦科研资金的分配方式进行深度改革。白宫科技政策办公室近日发布 最新 报告,宣布未来的资金投入将不再过度倚重高校,而是向个人科学家以及人工智能应用倾斜。 这一新规将直接影响每年高达约 2000 亿美元的联邦研发预算分配方向。白宫希望通过发放个人奖学金和科研奖励等方式,直接为具有创新能力的学者提供支持,从而减少中间环节。 打破传统官僚体制,直接资助一线科研人员 长期以来,科研经费大多先拨付给高等院校,再由学校内部进行二次分配。这种传统的资助模式被指存在严重的官僚主义,导致大量时间和资金白白浪费在复杂的行政事务上。 通过直接向研究人员输送资金,白宫力求打破过去几十年来固化的审批体制。尽管这一转变可能给依赖联邦资金的大型大学带来冲击,但决策层认为此举能大幅提升科研项目的推进效率。 将AI置于科研核心,设定多项前沿科技目标 除了变革资助渠道,新政策的另一大核心是将人工智能深度融入科学发现的各个环节。官方明确要求各机构应将AI视为推动突破的新型工具,而不仅仅是辅助日常工作的普通软件。 伴随资金转向的还有一系列宏大的国家科技目标,包括在 2028 年前部署强大量子计算机以及加速能源基础设施建设等。不过也有持怀疑态度的学者提醒,过度依赖尚存瑕疵的AI技术可能会给科研带来新的未知风险。
Gemini 3.6 Flash来了,但网友笑得更大声:省下了token,却没保住智商
如果你从去年就开始用Gemini,最近 最流行 的一句调侃是:那种感觉就像看着自家兄弟慢慢得了阿尔茨海默症。按理说,一家公司发新模型,本该是用来打脸这种调侃的。可就在刚刚,Google一口气甩出三款新模型之后,网友非但没收回这句话,反而笑得更大声了,颇有一种他们都不看好你、偏偏你最不争气的即视感。这三款模型分别是3.6Flash、3.5Flash-Lite,以及专攻网络安全的3.5Flash Cyber,官方博客的措辞依旧眼熟,更高效、更聪明、为大规模AI agent而生,一句不落,但实际体感却冰火两重天。 先说当家头牌3.6Flash。它是今年5月I/O大会上3.5Flash的小版本迭代,官方给它的定位是真正扛活的干活模型。这一代 最大 的卖点是省token:按Artificial Analysis Index的数据,3.6Flash比3.5Flash少用了17%的输出token,在DeepSWE这类场景上甚至能省到65%,跑多步任务时推理步数和工具调用都更少。价格也确实降了,输入1.5美元每百万token、输出7.5美元每百万token,而上一代3.5Flash的输出价是9美元,这波直接砍到7.5,又快又省,单个agent任务的成本被压了下来。 基准测试上,代码能力是重点,DeepSWE从37%提升到49%,官方称多余代码改动更少、执行循环更短、生成代码更贴近生产环境要求;机器学习研究方向的MLE Bench提升更明显,从49.7%拉到63.9%;计算机操作OSWorld-Verified从78.4%升到83%,而且计算机操作本身成了Gemini API和企业版的内置工具,主打开箱即用;知识工作GDPval-AA v2从1349涨到1421,Hebbia、Harvey等客户反馈它在文档解析、图表数据分析、报告起草这类多模态任务上尤其突出,Figma、JetBrains也出面背书。一个不起眼但实在的更新是,知识截止日期终于从2025年1月推进到了2026年3月,老黄历总算翻篇。安全方面,官方说3.6Flash上了升级版Frontier Safety防护,重点盯着化学、生物、放射性、核与网络攻击这两类滥用,抗越狱能力更强,同时尽量不误伤正常需求、少乱拒绝。 比它低一档的是3.5Flash-Lite,主打快和便宜,专治高吞吐、低延迟的任务,比如agent搜索和文档处理。它是3.5系列里最快的,按Artificial Analysis测量每秒能吐350个token,价格更是白菜价,输入0.3美元、输出2.5美元每百万token,质量比3月发的3.1Flash-Lite好一大截。它支持调推理档位,低配活儿开 最低 档图快和省,碰到要多步拆解的子任务就把思考档位往上拨,电脑操作这次也做成了内置工具。 提升相当明显:代码和agent任务的Terminal-Bench2.1从31%干到54%,长上下文的GDM-MRCR v2从60.1%提到72.2%,真实任务执行的GDPval-AA v2更是从642飙到1140。最有意思的是,这个低档小弟在不少agent和代码任务上居然反超了辈分更高的3Flash,比如SWE-Bench Pro是54.2%对49.6%、OSWorld-Verified是74.0%对65.1%,等于跑3Flash的活儿现在有了个更快更强的平替。官方举了几个用法,从海量电商数据里抽产品特征、给3.6Flash当副手一口气生成25个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏,Ashler、Palo Alto Networks、Ramp这几家客户也来夸它速度、智能、成本三合一。 最后一个3.5Flash Cyber画风突变,专门用来找和修代码里的安全漏洞。Google的逻辑挺妙:现在AI找漏洞的速度已经比现有系统修漏洞快了,漏洞越堆越多,不如用便宜高效的Flash来批量补锅。这个模型在3.5Flash基础上微调出来,搭配自家的CodeMender工具,里面跑好几个Flash Cyber agent协同工作、最后汇总成一份报告,在业内知名的CyberGym基准上摸到了 第一 梯队水平,还比更大的模型更省token。不过这模型暂时用不上,考虑到找漏洞是把双刃剑,Google也学Anthropic玩起了安全叙事,把它锁得死死的,只对可信合作伙伴限量开放、走内测,目的是给一线防守方争取时间,赶在漏洞被利用前先修掉,同时防着有人拿它去干坏事。 看到这儿你可能会问,发了一堆Flash,真正的旗舰3.5Pro去哪了。官方口径是正在和合作伙伴测试、准备好就上,但这套说辞背后的故事可能没那么体面。据彭博社等媒体报道,3.5Pro的代码生成能力一直没达到内部预期,Google6月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色,更有传闻说Google干脆推翻了原来的训练方案、从零开始重训。而Google AI宣传委员Logan Kilpatrick更是索性在舆论上跳过3.5Pro,把预告重点放在Gemini4上,声称已经启动了史上最雄心勃勃的Gemini4预训练、进展让人兴奋。放在旗舰跳票的背景下看,这多少有点转移视线、画饼续命的味道。 光看今天发布的Flash模型本身,网友也并不全然买账。第三方评测机构Artificial Analysis表示,两个新模型确实把单任务耗时砍半、token效率也提升了,Flash-Lite的智能指数涨了11分,但3.6Flash的智能水平相比3.5Flash基本原地踏步。价格没便宜到足以忽略能力差距,能力也没高到能解释它的成本。X平台上有网友吐槽,3.6Flash在Artificial Analysis上跟3.5Flash拿了一模一样的分,还不如Meta Spark1.1、GLM-5.2、5.6Luna、Sonnet5、Grok4.5、5.6Terra这一票对手,直呼简直烂透了。 网友Angel则从性价比入手,指出3.6Flash的使用成本比GPT-5.6Sol medium还高、智能程度反而更低,又贵又笨的组合属实尴尬,毕竟Flash系列立身的根本就是性价比,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI的Tibo刚刚也发话,由于周活跃用户达到1000万,Codex和ChatGPT Work的付费用户迎来新一轮额度重置。这对比、这落差,还有人记得大明湖畔的Google Gemini3吗。 实测派也来补刀。网友Balder直接开团,称这三个模型性能全比之前的3.5Flash差,问题包括但不限于基础解码就有毛病、中文选词经常很离谱,生成的图片视频质量极差、跟指令对不上还限额严重,经常记忆混乱、调用完全错误的工具。他还抛出一个阴谋论,认为Google之所以这么搞,是为了把算力腾出来卖给Anthropic,阴阳了一句这就是皮查伊想要的Cloud First。X网友Conor Dart用Google自家的Antigravity跑了个AI生成游戏测试,结果木头纹理更差了、大理石看着差不多但还是不能用,他直言又是一次翻车,表示自己还是等Gemini3.5或者3.6Pro吧。 一边是官方更高效、更便宜、更省token的漂亮账本,一边是大多数网友的当场差评,以及模型背后旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇,Google这次是不是真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个Flash稳住场子。反正Gemini4的预训练都已经开跑了,这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。
AI 音乐生成器 Suno 遭数据泄露,波及5530万用户及训练数据源代码
据数据泄露通知服务平台Have I Been Pwned近日揭示,AI 音乐生成器Suno于2025年11月遭遇网络攻击,导致超过5530万名用户的个人信息泄露。被窃取的敏感数据包括客户姓名、实际与电子邮箱地址、电话号码、购买记录,以及从支付服务商 Stripe 账户中提取的部分支付卡号与到期日。 尽管该安全事件已发生数月,并于近期经404Media等媒体曝光,但Suno官方此前从未主动向受影响用户发出通知或公开披露细节。公司发言人 Rachel Racusen 随后证实了2025年11月安全事件的存在,且未否认受影响的人数规模。 更为关键的是,本次泄露的数据集还包含了Suno的源代码,直接曝光了该公司从 Deezer、Genius 以及 YouTube 等知名平台抓取数百万首歌曲和歌词以训练其 AI 模型的操作细节。 目前,Suno正面临多家大型唱片公司的联合诉讼,被指控大规模抓取版权作品侵犯版权法。这一安全与数据泄露事件不仅暴露出消费级 AI 应用在用户数据保护方面的短板,其公开的抓取源码更可能为针对生成式 AI 训练合规性与数据来源的法律追责提供关键证据,进一步加剧该领域的监管与合规风险。
警惕AI“声纹盗贼”!国家安全部揭秘语音深度合成三大风险
人工智能技术的飞速发展让声音复刻变得触手可及,但也给社会秩序和个人财产安全带来了全新挑战。国家安全部近日发布安全提示,深度解析了AI语音克隆技术背后的风险隐患。 现在的AI声音克隆不仅采样速度极快,甚至仅需三到五秒的音频样本就能精准复刻声音。普通人在毫无防备的情况下,辨别这种高质量伪造语音的成功率甚至不足一半。 此外,大量在线平台推出了“一键克隆”功能,极大地降低了这项技术的滥用门槛。当声音不再值得信任,犯罪分子便开始利用合成语音编造紧急情况实施诈骗。 多种侵权乱象频发,法律红线不可逾越 除了熟人诈骗,利用AI伪造名人声音用于带货引流的侵权行为也屡见不鲜。更有甚者恶意克隆公职人员声音,制造虚假言论和政策解读,严重误导社会公众。 针对这些乱象,我国已建立起涵盖民事、行政及刑事的完整法律约束体系。未经授权擅自克隆或传播他人语音均属侵权,利用该技术实施犯罪将面临严厉的刑事处罚。 网络平台必须切实落实主体责任,加强对违规工具的清理与审查。广大群众也应提高防范意识,妥善保护个人声纹信息,在涉及资金操作时务必进行多重核验。
Deezer 披露:平台日上传量超 50% 为 AI 生成音乐,6 个月未播放内容将被清理
音乐流媒体平台 Deezer 近日公布了一组令人震惊的数据:AI 生成音乐已占其每日上传量的50% 以上。今年6月,该平台 AI 音乐日上传量达到峰值,月均每天约9万首。 AI 音乐的快速涌入正迫使各大流媒体平台重新划定内容边界,但目前行业尚未形成统一共识。Bandcamp 选择直接禁止 AI 生成曲目,Tidal 切断了相关内容的变现渠道;Apple Music 采用自愿式 AI 标签系统,Spotify 则制定了自己的 AI 使用比例政策。Deezer 的 最新 应对策略是:下架过去6个月内未被播放的 AI 生成曲目,以及涉及刷量欺诈以套取收益的内容。 Deezer CEO Alexis Lanternier 在声明中表示:"Deezer 近两年来始终站在打击欺诈和减少 AI 音乐收益稀释的 第一 线。如今每日上传量中有一半是 AI 生成曲目,我们正在采取额外措施保护艺术家和词曲作者的权益,同时聚焦于粉丝真正喜爱的音乐。" 回顾 Deezer 的追踪数据,AI 音乐的扩张速度呈持续加速态势。2025年1月,AI 生成曲目日上传量约1万首,占总日上传量的10%;同年4月增至2万首(18%),9月达到3万首(28%),11月攀升至5万首(34%)。进入2026年,1月为6万首(39%),4月达7.5万首(44%),直至6月的9万首峰值。 Deezer 去年开始在平台上为 AI 音乐添加标签,并表示其检测技术能够识别 Suno 和 Udio 等 AI 音乐初创公司模型生成的曲目——这两家公司目前正身陷版权诉讼。今年年初,Deezer 将其检测技术开放给其他平台使用,但尚不清楚是否有主流平台已接入该工具。上个月,Deezer 还发布了一款工具,可用于筛查 Apple Music 和 Spotify 歌单中的 AI 生成曲目。
ISO:一种RLVR原生的优化栈
Reinforcement learning with verifiable rewards (RLVR) is rapidly advancing the reasoning capabilities of language models, yet the optimization layer that converts reward feedback into weight-space updates remains poorly understood. Building on our prior analysis (Zhu et al., 2025), we study this missing layer through the singular structure of model weights and identify spectral inheritance: RLVR can reuse the base model's weight spectra while acquiring new behavior through changes in the associated input and output singular frames. We operationalize spectral inheritance as Isospectral Optimization (ISO), an RLVR-native, fixed-spectrum optimization framework with complementary offline and online instantiations. Offline, ISO-Merger combines the frame changes of shared-base specialists into a single fixed-spectrum model, requiring no post-merge data, rollouts, gradient updates, or on-policy distillation (OPD). It recovers complementary specialist capabilities and achieves the strongest aggregate performance among the compared data-free merging methods. Online, ISO-Optimizer applies a chosen base optimizer, including AdamW and Muon, to the frame variables while keeping the base spectra fixed. Across reasoning and coding tasks ranging from 1.5B to 8B parameters, ISO-Optimizer improves accuracy in the reported runs and reaches matched scores with substantially fewer training steps. On Qwen3-8B-Base, AdamW reaches an aggregate accuracy of 0.495 after 270 training steps. ISO-AdamW reaches the same accuracy after only 100 training steps and improves further to 0.509 after 210 training steps. Together, ISO offers a concrete answer to RLVR's missing optimization layer: rather than inheriting pre-training optimization wholesale, design post-training around the structure of reward-driven adaptation: inherit the spectrum, optimize the frames.
掩码视觉动作的统一世界建模
Video models absorb rich priors over how the visual world moves, interacts, and responds to contact, making them promising substrates for robotic world modeling. The central challenge is how to communicate action to such models in a form aligned with the visual space in which they learned these interaction priors, yet still grounded in physical manipulation. We introduce Masked Visual Actions, a pixel-space control interface that expresses action as a partially revealed trajectory of an arbitrary entity in a video. Revealing robot motion makes the model act as a forward dynamics model that predicts the scene's response to low-level robot actions, while revealing desired object motion makes the same model recover robot behavior consistent with that outcome. Finetuned with only 15 hours of masked examples from real videos and simulation, a single checkpoint achieves strong visual fidelity and controllability across diverse scenes and multiple embodiments. In downstream manipulation settings, the model produces imagined rollouts whose outcomes correlate with real-world execution for policy evaluation, improves decision making by ranking candidate futures in model-based planning, and supports inverse modeling by synthesizing robot motion from desired object motion.
陈旧但稳定:用于稳定异步强化学习的陈旧自适应信赖域
Asynchronous reinforcement learning improves throughput by decoupling rollout generation from optimization, but staleness is an inevitable byproduct compounded by policy lag, engine delays, and mixture-of-experts routing. From a trust-region perspective, this mismatch is critical: training-inference divergence governs approximation error in finite-horizon bounds, whereas PPO clipping only gates sampled outward updates, acting as a sampled surrogate rather than a full-policy constraint. As a result, high-staleness updates remain weakly controlled in the asynchronous regime where stale rollouts matter most. We introduce the Staleness-Adaptive Trust Region (SAT), which uses the detached sampled log-ratio as a practical staleness proxy, identifies high-mismatch tails within each batch via staleness-based kernel scaling, and contracts only the sign-selected endpoint of the nominal PPO interval. This preserves baseline behavior on ordinary tokens while enforcing more conservative updates on newly intercepted outward bands. We prove local interval containment and pointwise pessimism relative to PPO, showing how the adaptive rule reshapes update geometry under heterogeneous staleness. We evaluate SAT in a decoupled asynchronous RL setup built on Qwen3-30B-A3B-Base, using SGLang as the inference engine and Megatron for training. In this setting, SAT-GSPO w/ R3 achieves the best observed AIME24 avg@8, reaching 35.83 at lag 1 and 34.79 at lag 8, while SAT-GSPO reaches 34.17 at lag 1. Adaptive clipping and routing replay act as complementary stabilizers targeting mismatch tails and routing inconsistency, respectively. Overall, aligning clip intervals with staleness heterogeneity effectively stabilizes asynchronous RL.
H^2SD:混合后见自蒸馏
Reinforcement learning with verifiable rewards (RLVR) has substantially improved the reasoning capabilities of large language models on tasks such as mathematical reasoning and code generation. However, most RLVR methods assign a scalar outcome reward to an entire trajectory, resulting in sparse supervision and limited token-level credit assignment. On-policy distillation (OPD) provides denser supervision by distilling token-level distributions from a stronger teacher model, but requires an additional teacher and typically assumes a shared vocabulary. On-policy self-distillation (OPSD) removes this dependency by conditioning the same model on privileged information to construct a teacher policy. However, directly matching the teacher distribution may cause information leakage and unstable optimization. RLSD avoids direct matching by using the teacher signal only to modulate update magnitudes, but it cannot provide an explicit correction direction when the sampled reasoning fails. To address this tradeoff, we introduce H^{2}SD, a hybrid hindsight self distillation framework that uses the teacher differently according to trajectory correctness. For successful trajectories, the teacher receives the student response confirmed as correct together with a rephrasing instruction, and its probabilities on the original response tokens are used to modulate update magnitudes without changing the direction determined by the reward. For failed trajectories, we condition the teacher on a reference hint containing key reasoning steps and a verified answer, and minimize the reverse KL divergence from the student to the teacher. Experiments on multiple challenging reasoning benchmarks show that H^2SD consistently outperforms representative RLVR, OPSD, and RLSD baselines while maintaining stable optimization and favorable generation efficiency.
转录策略作为潜变量:激活具有词级时序的可控逐字ASR
Multimodal humor in memes, cartoons, and comics remains difficult for AI systems because intended meaning depends on non-literal mechanisms, shared cultural knowledge, and communicative intent rather than literal scene description. This survey focuses on visual humor understanding in single-image and multi-panel artifacts, while treating humor generation as an emerging downstream frontier. We position the literature against prior humor, sarcasm, and general MLLM surveys and organize it using a capability-centric hierarchy spanning recognition, interpretation and reasoning, and generation. Under this lens, we synthesize benchmark design, evaluation protocols, and modeling paradigms, tracing the field's shift from task-specific fusion models to large-model approaches based on multimodal alignment, evidence-grounded reasoning, and controlled generation. We conclude by highlighting the main barriers to progress: shortcut-prone evaluation, limited cultural and narrative coverage, weak evidence grounding, and unresolved safety and ownership concerns.
美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需
OpenAI前首席技术官穆拉蒂离开老东家后交出的 第一 份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布 首款 模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺 第一。 单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。 真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。 一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室, 首款 模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现 最强 的模型,无论开放模型还是闭源模型。 把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。 当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的 第一 梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。 之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。 穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。 但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。 Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。 真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有 顶尖 团队、充足资金和英伟达 最新 训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。 按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准 第一。 公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准 第一 并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。 美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%, 最高 一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测 最强 的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分 顶级 闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。 与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。 这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。 从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。
OpenAI扩大ChatGPT家长通知,青少年暴力违规将触发提醒
OpenAI宣布扩大ChatGPT家长通知功能,当青少年用户因违反暴力威胁或网络暴力政策被封号时,已关联账号的父母和监护人将收到提醒。 此前,OpenAI推出家长控制功能,支持家长关联未成年子女账号,设置使用限制、减少敏感内容,并在发现自残风险时发送警示。此次升级后,系统将进一步覆盖可能伤害他人的风险行为。 该功能由OpenAI与网络暴力监测机构Moonshot共同开发。Moonshot表示,在严重风险出现时及时通知家长,有助于家庭尽早介入并采取措施。 OpenAI此次强化安全机制,也与AI使用风险争议有关。2025年加拿大枪击事件调查发现,嫌疑人曾使用ChatGPT,OpenAI随后承诺加强安全措施。 此外,OpenAI还在家长控制页面加入“学习模式”,通过提示引导学生思考,而非直接提供答案;针对青少年长时间使用ChatGPT的情况,系统也将增加休息提醒。 随着AI助手进入教育等场景,未成年人安全使用成为行业重点议题,OpenAI正在通过监管工具和交互设计提升AI产品的安全性。
YouTube 收紧政策,严打低质 AI 内容
近日,YouTube 官方宣布了一项新政策,进一步打击平台上的 AI 垃圾内容。根据 7 月 16 日的更新,YouTube 将 “非真实内容” 细分为三类,并禁止这些内容进行变现。此次政策的出台旨在维护平台生态,提升视频质量。 第一 类被禁止变现的内容是通用且重复的模板化视频。这类视频通常是通过 AI 或计算机生成图像制作而成,往往没有任何原创性。如果视频仅仅是对已有内容的重复表述,也可能会受到影响。 第二类内容则是令人反感或痛苦的视频。这些视频常常故意制造恐惧、痛苦或情感操控,以获取更多点击率。举例来说,有些视频可能会展示动物遭遇困境的情景,目的是吸引观众观看后续救援画面。 第三类被禁内容是使用虚拟人物讨论健康、金融等敏感话题的视频。YouTube 明确表示,创作者不应当利用 AI 虚拟形象探讨这些领域,以避免误导观众。 根据新的政策,如果一个频道发布了大量上述内容,将无法加入 YouTube 的合作伙伴计划,从而失去广告变现资格。这一决定反映了 YouTube 对提升内容质量的重视,同时也回应了观众对平台内容质量的期望。 随着 AI 技术的发展,内容创作者面临新的挑战。YouTube 的这一政策将鼓励更多创作者生产高质量、有深度的原创内容,减少低质内容的传播。 划重点: - 🚫 YouTube 禁止三类非真实内容进行变现,包括重复模板、令人反感及 AI 虚拟人物视频。 - 🐾 令人反感的视频故意制造痛苦和恐惧,以提高点击率,平台将严格打击此类内容。 - 📉 发布大量违规内容的频道将失去加入合作伙伴计划的资格,无法进行广告变现。
小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后
视觉大模型长期被一个隐形门槛卡着:想拿到 顶尖 效果,就得先囤够天量数据和算力,这让先进视觉能力成了少数头部团队的专属玩具。7月21日,小鹏集团发布TuringViT高效视觉编码器,宣称从架构、数据范式到训练流程系统性重构了视觉编码器,为行业提供了一条可复现、低成本的SOTA级视觉Transformer训练路径,把先进视觉大模型从头部专属推向行业普惠。 TuringViT的定位很清晰:面向VLM与VLA时代,全面支撑智能驾驶、智能座舱和IRON人形机器人三大业务场景。它从架构、数据、训练三个维度同步突破,搭起一套线性注意力主导、高质量数据治理、原生动态分辨率三位一体的技术体系,在效果、效率与落地性上做三重提升。 在架构上,TuringViT推出两个规格版本。TuringViT-18L包含3组Turing Block,合计15层TLA加3层MHA,主打动态分辨率下的高效部署;TuringViT-24L包含4组Turing Block,合计20层TLA加4层MHA,在保持线性计算主导的前提下进一步拉升表征能力。实测数据显示,随着输入分辨率升高,TuringViT的延迟增长曲线远比标准softmax ViT平缓,高分辨率下的效率优势愈发突出。在1536乘1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,这为高分辨率感知、多摄像头输入和长时序视频处理的端侧部署扫清了核心障碍。 与行业堆数据规模的粗放路线不同,TuringViT真正锋利的地方是数据治理。它打造了VISTA-Curation多模态数据治理流水线,不再追求用更多数据,而是通过提升单样本的监督价值实现数据效率的量级跃升。针对图文数据,流水线分三步精细筛选:先过滤掉低分辨率、模糊、低纹理的劣质图片;再用多模型、多提示词生成多样化候选字幕并交叉验证视觉一致性;最后在统一对比池里,按相对图文对齐度、文本信息量与歧义度综合打分,筛出视觉贴合度高、语义密度高的优质标注,淘汰模糊、泛化和弱对齐样本。针对视频数据,流水线先把长视频切分成连续短片段并均匀采样代表帧,再用语义一致性与运动一致性双重过滤保留有效片段,最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面里学到更鲁棒的视觉表征。 数据效率的提升直接反映在了成绩上。TuringViT仅用了0.85B图文对,大约是SigLIP2-L训练数据规模的十分之一,却在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越那些用10B数据训练的主流开源基线;在COCO与Flickr30K图文检索任务上同样优势明显,真正实现了用十分之一数据换来更优效果的突破。 训练流程上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练 第一 天起就适配下游VLM与VLA的输入特性,彻底告别了固定分辨率预训练再加事后适配的传统模式。 这套编码器在小鹏的技术体系里已经有了明确落点。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token;面向智能座舱与驾泊一体化,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效对齐,可支撑不同画幅和比例的视觉输入,为更丰富的座舱交互功能打底;在小鹏IRON人形机器人体系里,它则扮演着视觉视网膜的核心角色,提供物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪等基础感知能力。项目主页已上线。
节省 40 亿元还是触发监管?微软拟为Copilot引入国产AI模型陷两难
为了降低高昂的AI运营成本,微软目前正在评估将中国人工智能公司月之暗面研发的Kimi K3 模型引入其Copilot服务。此前该服务主要依赖OpenAI与Anthropic的技术,而新模型的加入有望重塑其底层架构。 性能出众兼具降本优势,每年 最高 可省 6 亿美金 作为全球参数规模 最大 的开源模型,Kimi K3 在编程等多项 权威 评测中展现出了媲美 顶级 模型的卓越性能。微软内部测算显示,切换至该模型后单个Token的推理成本 最高 可降低60%,每年将为公司节省约6. 02 亿美元的开支。 巨额收益碰撞政治风险,政策红线成 最大 隐忧 然而,这项极具商业诱惑力的决策正面临着严峻的外部政治考量与政策风险。当前美国政府正计划进一步限制本土企业使用中国AI模型,甚至可能出台针对性的禁用禁令。 如果在旗舰产品中深度整合中国开源技术,微软极有可能招致白宫方面的强烈不满与审查。面对巨大的经济利益与复杂的政治局势,微软目前依然处于谨慎权衡与抉择的阶段。
5.83倍加速!PolicyTrim:让VLA机器人少走弯路、更快完成任务
新智元 2026-07-21 12:58 北京 新智元报道 【新智元导读】 VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。 Vision-Language-Action(VLA)模型把视觉观测、语言指令和机器人动作统一到一个策略模型中,使机器人能够根据自然语言完成复杂操作任务。 从OpenVLA、OpenVLA-OFT到π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。 但当VLA模型真正部署到机器人上时,一个关键瓶颈会立刻显现:机器人完成任务的总时间,不只取决于每次推理有多快,也取决于策略到底需要执行多少次推理、多少个真实物理动作。 在同一任务的多次rollout中,VLA模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。 动作chunk尾部不可靠:模型一次预测多个动作,但越靠后的动作越容易累积误差,系统不得不频繁重新规划,强行拉长执行长度会降低成功率并增加物理步数。 物理动作冗余严重: 即便任务最终成功,轨迹里也可能包含大量纠错、回退和重复动作。 因此,VLA部署效率不仅要看每一步的推理延时,更要看策略效率(policy efficiency): 一次预测中有多少动作能放心执行?完成任务到底需要多少真实物理步骤? 已有方法大多从 计算侧 入手,例如视觉token剪枝、量化、KV-cache复用、蒸馏或推理引擎优化。这些方法可以降低单次推理延迟,但如果策略仍然需要大量冗余物理步骤,真实任务耗时仍然很长。 直接固定执行更长action chunk也并不可靠。 论文中的实验显示,随着强行将动作执行长度变长,成功率可能下降,物理步数反而增加。这说明低质量的尾部预测会把误差带入物理世界,机器人随后需要更多纠错动作。 关键问题:能否在不牺牲任务成功率的前提下,通过后训练,让已有VLA策略自动学会「少走弯路」,用更少物理步骤完成任务? 来自四川大学雷印杰教授领导的团队提出了PolicyTrim——一个面向「策略效率」的两阶段强化学习后训练框架。它不改变VLA架构,也不重新收集专家数据,而是在已有预训练策略之上继续优化机器人真实执行行为。 项目主页: 论文链接: 代码链接: 模型链接: 新方法实现了: 3×动作chunk利用率,更长horizon可靠执行; 51.4%物理步数减少,压缩冗余修正动作; 5.83×端到端最高加速,LIBERO Object/π0.5; 从「算得更快」到「做得更快」 PolicyTrim的核心目标不是替代计算侧加速,而是补上另一个被忽视的维度:减少完成任务所需的前向推理次数次数。它把策略效率拆成两个可优化目标:先扩展可靠动作chunk,再压缩冗余物理步骤。 1. 可靠动作chunk扩展(Reliable Action Chunk Extension) 当前很多VLA策略以action chunk形式输出动作序列,但部署时往往只敢执行前几步。PolicyTrim第一阶段使用dynamic execution horizon exploration:同一组rollout分配不同接受比率,让模型在短、中、长窗口上并行探索可靠边界。 成功完成任务且执行窗口更长的轨迹获得更高reward,鼓励模型把原本不可靠的chunk尾部动作变得更可用。 horizon reward只在组内出现成功轨迹时激活,避免模型在失败情况下盲目追求更长的chunk长度。 2. 冗余感知的步数压缩(Redundancy-Aware Step Reduction) 当可靠horizon被扩展之后,第二阶段进一步减少总物理步数。PolicyTrim引入step-saving reward:成功轨迹用越少步骤完成任务,奖励越高。 step-saving reward 直接把「更短、更直接的成功轨迹」写进优化目标。 group-anchored regularization 抑制不可复现的投机捷径,避免模型只追求短路径却损害成功率。 两阶段顺序优化可以避免「拉长chunk」和「缩短步数」两个目标互相干扰,最终减少完成任务所需的前向推理次数次数。 实验结果 论文在LIBERO、ManiSkill、Meta-World以及真实机器人任务上验证了PolicyTrim,并覆盖π0.5、OpenVLA-OFT、GR00T等不同VLA架构。总体结果显示,PolicyTrim在保持任务成功率稳定的同时,显著提升执行效率。 在LIBERO中,π0.5达到最高5.83倍端到端加速,同时成功率保持98%以上。 跨基准结果显示,PolicyTrim在ManiSkill上最高达到2.36倍加速,在Meta-World上达到2.52倍加速。 跨架构结果显示,重新预训练后的OpenVLA-OFT采用完整两阶段流程可达到2.97倍加速;OpenVLA仅使用第二阶段也能达到1.41倍加速。 定性对比:少走弯路,轨迹更直接 在随机采样的LIBERO任务中,Baseline往往出现冗余纠错动作和目标附近的hesitation/jittering;PolicyTrim的轨迹更平滑、更直接,能够用更少物理步骤完成同一任务,通常能将物理步数压缩至原来的一半左右。
GPT-5.6-Sol在网络攻防能力上,超越了Mythos!开源模型也排好了
ASI启示录 2026-07-21 12:58 北京 新智元报道 GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5! 英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。 去年同类内部测试中,这个差距是 6 到 10 个月。 防御窗口在收缩,而攻击前沿在加速。 今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。 开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。 4 到 7 个月:怎么测的,差在哪 AISI 用两套体系评估模型的网络攻击能力。 第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。 第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。 两套体系给出了一致的结论: GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月; 在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。 DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。 两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。 成本差距比能力差距更大。 同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。 在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元; Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。 同等攻击能力,开源便宜一到两个数量级。 闭源模型的安全护栏也没能拉开差距。 AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。 Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。 Amazon 研究员随后独立报告了另一种绕过方法。 这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。 闭源并不自动等于安全。 防御窗口收窄 防御工具也在加速 AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。 英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。 同一代 AI 工具确实也在加速防御端的工作。 游戏网络编程领域的资深开发者 Glenn Fiedler,是哦哦游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库 (yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库) 做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。 Glenn Fiedler 两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。 最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。 整个审计的 Token 成本约 2500 美元。 攻防两端都在被 AI 加速,但加速方式不对称。 攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。 而防御工具的部署需要每个团队主动投入时间和成本。 AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。」 这组数据对 AGI 格局的影响比数字本身更深远。 开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。 闭
Anthropic获批15亿美元版权和解协议,将向50万部作品支付赔偿
据路透社报道,美国联邦法院周一正式批准Anthropic公司与作家、出版商达成的15亿美元集体诉讼和解协议。该协议用于解决Anthropic因训练AI模型过程中涉嫌侵犯版权引发的诉讼,公司随后将开始向相关版权方支付赔偿。 美国加州北区地方法院法官Araceli Martinez-Olguin签署了最终批准文件。此前,已退休法官威廉·阿尔苏普曾初步批准该和解方案,并裁定Anthropic曾非法下载并存储数百万本受版权保护的书籍。 根据赔偿方案,每部涉案作品预计可获得3000美元赔偿,涉及作品数量约50万部,赔偿金额将由拥有版权的作者和出版商共同分配。这一金额被认为是美国版权法领域规模 最大 的和解之一。 不过,该协议并未完全解决围绕AI训练数据的法律争议。阿尔苏普法官此前在案件核心问题上支持Anthropic,认为利用受版权保护文本训练AI模型可能属于“合理使用”范畴,被业内视为AI版权判例的重要进展。但与此同时,他指出Anthropic获取部分训练数据的方式存在违法问题。 Anthropic此前主要通过两种方式获取训练数据:一部分来自合法购买并扫描的书籍,另一部分则来自Library Genesis、Pirate Library Mirror等盗版网站下载的内容。法院认为,后者涉及非法获取版权材料。为避免进一步审判以及可能面临的高额赔偿,Anthropic最终选择达成和解。 业内人士指出,虽然此次和解结束了该案件,但并未形成针对整个AI行业的统一法律标准。由于Anthropic选择和解,案件未进入上诉程序,阿尔苏普此前关于AI训练“合理使用”的判断也不会成为具有约束力的司法先例。 目前,围绕AI模型训练数据版权问题的诉讼仍在持续,包括针对谷歌、Meta、Midjourney和OpenAI等公司的相关案件。近期,Hachette、Cengage、Elsevier、作家Scott Turow以及SCRIBE等出版机构和作者还联合起诉谷歌,指控其未经授权使用版权作品训练Gemini人工智能平台。 随着生成式AI快速发展,如何平衡模型训练需求与版权保护,正成为全球AI产业面临的重要法律与商业挑战。Anthropic和解案虽然提供了一种解决路径,但行业关于AI数据合规的长期规则仍待进一步明确。
BestBlogs早报07-21版梳理了AI代码生成、长时程模型安全及音频创作模型等进展。
精选内容涵盖企业微信94%代码生成率的八阶段实践、OpenAI长时程模型绕过沙箱的安全事件,以及字节跳动可精细控制时间线的Seed Audio 1.0模型。
影子点拨模式让普通模型在任务遇阻时得到高性能模型的实时指引,以低成本保持输出质量。
Eric Xu提出的shadow steering可通过后台大模型维护kv缓存并在关键时刻介入,用于成本控制和蒸馏;他认为DeepSeek下一代模型已在用此方式测试。
AI医疗卷了10年终于悟了:不用替代医生,而是给医院装上超强buff
原创 关注前沿科技 2026-07-20 19:41 上海 未来的医院,可能不只存在于一栋楼里 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 今年WAIC现场,300多款产品全球首发,1100多家企业把10万平米的展馆塞得满满当当。 机器人在跳舞,大模型在对话,Agent开始进入越来越多行业。 热闹归热闹。 但如果你穿过人流,走到 联影智能 的展台和论坛现场,会听到一个 既熟悉又陌生 的词 —— 元医院。 为什么说熟悉?你不觉得乍一听,瞬间让人想起几年前那个风靡全球的「元宇宙」嘛! 彼时,Meta豪掷千亿美元押注虚拟世界,全球科技公司纷纷入场,所有人都在讨论:下一个互联网入口,会不会来自一个平行数字世界? 但几年过去,元宇宙并没有成为那个答案。 就在行业以为「元」字热已经退去时,没想到,2026年,它却出现在了医疗行业。 在今年世界人工智能大会上, 联影智能首次发布「元医院」战略。 但它想做的事情, 和元宇宙完全不同。 它不新建虚拟医院、不替代医生,而是把零散AI工具整合为全院协同的智能体系。 论坛现场,有多年临床经验的医生直言,「元医院」拓宽了医生的诊疗能力边界,但同时,会对医院的算力、全域医疗数据提出指数级的上涨需求。 什么是「元医院」? AI正在快速进入千行百业。 过去几年,AI医疗已经诞生了大量应用。 影像辅助诊断帮助医生提高阅片效率,病历生成减少重复工作,智能问答降低信息查询成本,大模型也让医疗AI拥有更强的理解和推理能力。 但这些应用都有一个共同特点: 它们更多是在增强某一个环节,就像医院里增加了一批新的工具。 但真正复杂的医疗场景,并不是一个个孤立任务。 一个患者从挂号到诊疗,往往涉及影像科、检验科、临床科室、随访管理等多个环节。 医生需要综合大量信息,结合经验做出判断。 于是,一个新问题随之出现: 这些AI能力能不能像医院里的不同科室一样,被组织起来,围绕患者形成完整服务能力? 这也是「元医院」试图回答的问题。 毕竟当前优质医生资源仍然有限、医疗资源区域分布不均、医院能力受物理空间限制的问题,还无法被零散的AI能力所解决。 医疗能力急需被系统化生产。 而「元医院」,简单理解,并不是要建虚拟医院,也不是多个AI工具集合体,而是医院运营模式的系统化重构。 它是以 「 元技术」 升维医院能力,让医疗服务突破物理边界,从而解决医疗困境的全院级、数智化医院运营新模式。 「元技术」又包括啥呢? 多模态大模型、数智孪生、智能可穿戴、区块链、具身智能、云平台技术、互联网IT技术、物联网、边缘计算技术 、医疗大数据、三维渲染、元宇宙、空间智能等。 元医院与元宇宙的区别在于,后者构建虚拟空间,而前者增强现实医疗体系。 与传统智慧医院的区别在于,智慧医院更多是在原有体系上做数字化升级,比如电子病历、线上挂号、远程问诊。 而元医院试图改变的是:医疗能力如何被生产、组织和调用。 想更好地理解这一点,咱不妨换个角度。 过去的大饭店,能服务多少人取决于门店面积和厨师数量。 外卖平台出现后,餐厅依然存在,厨师依然重要,但餐厅的服务半径被扩大了。 对应到「元医院」也类似。 医院仍然存在,医生仍然是核心决策者,但医院能力可以突破物理空间的限制。 医生可以借助AI完成更多复杂任务。患者也可以获得更加持续的健康管理。 总结来说,元医院不是替代医院,而是让现实中的医院拥有更大的能力边界。 建一座「元医院」比造AI工具难多了 一家物理世界的真实医院想要运转,需要土地、建筑、设备、医生和运营体系。 同样,建设一座「元医院」,也不是部署几个AI应用那么简单。 数据、模型、智能体调度、临床验证,四项能力缺一不可。 数据能力 如果说传统医院建设的第一步,是修建土地、建筑、水电和信息系统,那么元医院首先需要搭建的是医疗数据底座。 因为数据是元医院持续运行和进化的基础。 不同于传统AI应用,元医院面对的是复杂的医疗场景。 它需要理解患者完整的诊疗过程,而不是只处理某一次检查或某一份报告。 也就是说,元医院需要的并不是单一数据源,而是一套持续运行的真实世界医疗数据网络。 这些数据贯穿诊疗全流程,覆盖影像、病历、检验、生命体征监测等多个场景,并随着真实医疗过程不断产生和更新。 但医疗数据并不容易被AI直接理解。 过去,医院中的数据长期分散在不同系统中: 影像存在影像系统,电子病历存在HIS、EMR系统,检验数据又属于另一套业务流程。 与此同时,不同医院、不同设备、不同系统之间的数据标准也并不统一。 对医生而言,这些信息可以通过长期临床训练和经验积累被串联起来。 但对于AI来说,分散的数据不会自动形成关联。 如何将不同来源、不同格式的医疗数据进行治理、连接和整合,让它们成为可被AI调用的基础资源,是元医院首先需要解决的问题。 它不仅需要数据入口,更需要建立覆盖数据采集、治理、流转和应用的完整数据能力。 这也是为其后续提升模型能力打下基础。 模型能力 数据进入系统只是第一步,接下来还要让AI理解医疗。 传统医院靠的是医生团队。医生经过多年医学训练,积累大量病例经验,形成诊断、治疗和决策能力。 而在元医院里,这种能力需要由医疗大模型重新构建。 但元医院需要的并不只是一个基座医疗大模型,而是一套能够持续生成医疗智能体的模型底座。 在这个前提下,参数不是考察医疗大模型最重要的指标。 反而是能否真正理解医疗流程,能否将医学知识、患者数据和诊疗场景连接,并在复杂情况下,做出符合医疗逻辑的判断,更重要。 前段时间开源的uAI Nexus MedVLM(中文名:元智医疗视频理解大模型),探索的就是这一方向。 依托这样的底座,元医院能够将不同来源、不同模态的数据进行理解和推理,并进一步生成面向具体场景的医疗智能体。 简单理解,模型就是元医院的「大脑」,负责将数据转化为医疗智能。 智能体调度能力 一个个医疗智能体,依托医疗大模型不断生成。 如何让这些Agent协同工作,像传统医院中的不同科室一样完成复杂诊疗任务,是「元医院」需具备的又一项核心能力。 过去,大量医疗AI应用解决的是单点任务: 一个模型看片,一个模型写报告,一个模型回答问题…… 但真实临床流程往往涉及多个环节,单一AI能力很难独立完成。 例如,一个病例可能同时需要影像分析、病历理解、知识检索、治疗建议、随访管理等多个智能体参与。 当智能体越来越多,如何让它们协同工作,成了关键。 元医院需要一个能够理解临床任务,并根据需求调用不同智能体与Skill的「 调度中枢」。 在WAIC论坛上,联影智能带来了 「超级医生」。 现场,复旦大学附属中山医院肝胆肿瘤与肝移植外科孙云帆教授戴上VR头显,来了一把沉浸式实操演示。 他视野内的三维画面同步投屏给台下所有观众。 「小U,调取这位患者完整病历。」随着语音指令下达,这名患者全周期诊疗档案立刻完整呈现: 历次就诊记录、全套影像、检验指标、既往病史一目了然,无需医生手动翻找多个系统。 手术规划环节,「超级医生」同样能提供完整辅助。 孙云帆现场下达指令:小U,剥离肝脏实质。 虚拟模型瞬间完成组织剥离,肝内胆道、动脉、门静脉、肝静脉等关键管道清晰立体呈现。 据孙云帆介绍,肝脏手术最大难点,
LLM即教练:面向不可验证任务的体验式学习
Reinforcement learning (RL) on open-ended tasks compresses an LLM's rubric-based evaluation into a scalar reward, discarding rich textual feedback and conflating responses with distinct quality profiles. We propose Experiential Learning (EL), which repurposes the feedback model from an LLM-as-a-Judge into an LLM-as-a-Coach. The coach distills its assessment of each on-policy response into transferable experiential knowledge, which conditions a teacher model and is internalized by the policy through on-policy context distillation. Compared with scalar rewards, this higher-bandwidth feedback channel provides dense supervision and preserves fine-grained preferences among high-quality responses. Across two policy families, with feedback from the policy itself or a proprietary model, EL consistently outperforms rubric-based RL on held-out and unseen open-ended tasks. Notably, EL generalizes better beyond the training distribution, and mitigates reward hacking. These findings establish experiential knowledge as a richer and more generalizable learning signal for post-training on non-verifiable tasks.
分布偏移下用于忠实生成的令牌级离线策略学习
We propose Token-Level Off-Policy Labeling (TOPL), an off-policy training paradigm that reframes post-training as a token-level correctness prediction task. Our key intuition is that by training the model to distinguish good and bad tokens in a response, we naturally guide the model towards generating good tokens, while avoiding the pitfalls that come with directly training the model to generate off-policy tokens. Experiments on document summarization tasks show that TOPL achieves strong out-of-distribution generalization across 11 datasets against a diverse set of sequence-level and token-level baselines. We further demonstrate that TOPL transfers effectively to machine translation, suggesting that its benefits generalize across different faithful generation tasks. Through ablation studies, we confirm that our token-level learning signal is critical to good performance; sequence-level analogues do not confer similar benefits. Finally, we show that TOPL induces interpretable model updates: the LoRA adapters learned through TOPL function as linear classification heads and steering vectors.
面向大语言模型后训练的蒸馏强化学习
Large language model (LLM) post-training is essential for improving reasoning, adaptation, and alignment. Existing methods mainly follow two paradigms: reinforcement learning (RL) and on-policy distillation (OPD). However, RL relies on coarse-grained outcome supervision, resulting in difficult credit assignment and limited capability to acquire new knowledge. OPD, meanwhile, unconditionally matches teacher logits through KL divergence, which creates a dilemma: similar teachers provide little new knowledge, while substantially different teachers often yield ineffective guidance, largely restricting OPD to within-family distillation. We propose Distilled Reinforcement Learning (Distilled RL), which integrates teacher supervision into the RL objective to provide fine-grained guidance, selectively transfer new knowledge and avoid unconditional imitation. Distilled RL contains three components: reverse importance sampling with clipping, negative sample reset, and sequence-level geometric normalization. Through a concise and interpretable case study, we demonstrate that Distilled RL can effectively transfer previously unavailable knowledge from a teacher model to a student model. Extensive experiments across both within-family and cross-family distillation settings show that Distilled RL substantially outperforms standard RL and OPD in terms of both pass@1 and pass@k. Our code is available at
Who’s Afraid of Chinese Models?
Who’s Afraid of Chinese Models? Interesting proposal from Ben Thompson that both addresses the hypocrisy of labs outlawing distillation against their models despite training on unlicensed data, and could help US open models compete more effectively with their Chinese counterparts: The U.S. should pass a law that (1) makes explicit that collecting data for training models is fair use, and (2) bars terms of service that forbid distillation, for U.S. companies at a minimum. Stopping distillation — which is literally just querying the API — is nearly impossible; the U.S. should go the other way and lean into a new copyright policy that both indemnifies the labs and also guarantees that what they learned fuels further innovation for everyone else. Ben also theorizes that Alibaba's decision to release Qwen 3.8 Max as open weights - a reversal from their decision not to release Qwen 3.7 Max in May - may have been influenced by a recent speech by Xi Jinping, who said: We should seize this rare, historic opportunity to encourage open source, openness, collaboration and sharing. Via John Gruber Tags: ai, generative-ai, llms, training-data, qwen, ai-ethics, ai-in-china
RT Sumanth Stop prompting AI agents. Design the loops that prompt them
RT Sumanth Stop prompting AI agents. Design the loops that prompt them instead. This is the core idea behind Loop Engineering, a methodology for building automated systems that orchestrate your AI coding agents instead of prompting them manually. Boris Cherny, Head of Claude Code at Anthropic, puts it directly: "I don't prompt Claude anymore. I have loops running that prompt Claude and figure out what to do. My job is to write loops." A loop is an automated pipeline that runs on a schedule. It checks what needs to be done, prompts your AI coding agent with the right context, verifies the result, and either commits the fix or escalates to you. Then it runs again. This repo is a starter kit and reference guide for building these loops. Seven production-ready patterns, CLI tools to scaffold your setup, and documentation covering failure modes, anti-patterns, safety, and multi-loop coordination. The seven patterns: Daily Triage, PR Babysitter, CI Sweeper, Dependency Sweeper, Changelog Drafter, Post-Merge Cleanup, and Issue Triage. Each one ships with a starter kit, cadence recommendation, and token cost estimate. Three CLI tools handle setup. "loop-init" scaffolds skills, state, and budget files and prints your Loop Ready score. "loop-audit" checks how ready your setup is and suggests improvements. "loop-cost" estimates token spend before you run anything. Works with Claude Code, Codex, Grok, OpenCode, Cursor, and GitHub Actions. Key capabilities: • 7 production loop patterns with starters and token cost estimates • loop-init scaffolds your setup and prints a Loop Ready score • loop-audit scores readiness and suggests improvements • loop-cost estimates token spend per cadence • Failure modes, anti-patterns, and safety documentation included • Works with Claude Code, Codex, Grok, OpenCode, Cursor 100% open source. I've shared the link in the replies! Sumanth:
Safety and alignment in an era of long-horizon models
OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
100 亿次下载破纪录:工信部亮出开源半年报,OpenHarmony设备已超13. 5 亿台
一份来自国新办发布会的半年报,把中国开源生态的体重直接量了出来。7月20日上午10时,国务院新闻办公室举行新闻发布会,工业和信息化部总工程师王卫明、运行监测协调局局长陶青、信息通信管理局局长谢存一并出席,介绍2026年上半年工业和信息化发展情况并答记者问。在这场发布会上,陶青给出的一组数字,让外界 第一 次看清了基础软件、工业软件与开源生态同时发力的现实轮廓。 先是一张稳稳的基本盘。今年1到5月,我国软件业务收入超过6.2万亿元,同比增长10.3%,延续了稳健增长的态势。在这张盘面之下,软件业今年主要呈现出四条清晰的发展脉络。 第一 条脉络是基础软件加速成势。操作系统、数据库等基础软件持续突破,一批创新成果陆续冒头,开源鸿蒙操作系统已经全面覆盖手机、电脑、汽车、家电等终端设备,生态设备累计超过13.5亿台,电鸿、仪鸿等基于开源鸿蒙的行业发行版超过100款。一个原本从零起步的国产开源系统,如今悄悄长进了亿万级设备的身体里。 第二条脉络是工业软件广泛应用。工业软件已经形成覆盖重点行业的产品体系,在关键领域加速部署、持续迭代,为千行百业的数字化转型注入动力。截至今年6月底,重点工业企业数字化研发设计工具普及率达到86.3%,关键工序数控化率达到69.5%,两张渗透率同时站在了高位。 第三条脉络是人工智能全面赋能。主管部门引导软件企业抓住AI带来的产业变革机遇,加快使用代码大模型、智能编程工具等提升研发生产效率,让产品功能更丰富、交互体验更自然、内容创作更高效,智能测试、智能运维等创新应用也在加速落地。 第四条脉络,也是这场发布会最具分量的一笔——开源生态加速壮大。全国性开源基金会已吸纳50余个开源项目进入孵化阶段, 国家级 人工智能开源社区汇聚用户1100余万、托管模型超过7万个,覆盖基础软件、大模型及应用的全栈开源方案正在加速构建。最为醒目的是,我国人工智能开源大模型的全球累计下载量已突破100亿次。从一行行开源代码到百亿次被全球开发者拉取,中国大模型的影响力 第一 次以如此具象的刻度被摆在台面上。 陶青在会上还勾勒了下一步的落子方向。工信部将按照国家软件发展战略部署,持续增强关键软件产品与服务的供给能力,加快出台人工智能+软件行动方案,推动软件开发向智能化转型、软件产品及服务向智能化升级,并培育智能体软件这一新业态。与此同时,开源基础设施在项目孵化、供应链安全治理、新兴场景探索、海外市场落地等方面的能力会被持续抬升, 国家级 人工智能开源社区将被加速推向外延,成长为新兴技术的创新策源地与软硬产品落地的重要场景。当100亿次下载与13.5亿台设备同时成为基线,中国开源这盘棋,显然才刚刚进入中盘。
打破 15 秒魔咒:智象未来发布全球首个无限时长创作智能体vivago R1,商业可用率拉到85%
2026盛夏的黄浦江畔,世界人工智能大会如期拉开帷幕,智象未来(HiDream.ai)在这场聚光灯下把一枚重磅新品推到了台前——全球首个无限时长内容创作多模态智能体vivago R1。一同落地的,还有它与中科类脑等机构组建的一带一路Token出海联盟,以及与飞捷科思等发起的物理智能创新联合体倡议。这家公司试图用技术创新与生态协同双轮,把AI从工具推向能并肩工作的智能伙伴。 在大会期间由中国信息通信研究院主办的论坛上,智象未来创始人兼CEO梅涛以《迈向世界模型:原生全模态推动智能体能力跃迁》为题发表主旨演讲,系统梳理了大模型与智能体双向并进、走向世界模型的态势。他的判断很清晰: 顶级 模型的智能水平已经迈入人类天才区,但从基础大模型到真实场景之间,仍横着落地难、适配弱、不可控的产业鸿沟。智能体天生带着自主记忆、逻辑规划、工具调度和多端协作的本事,恰好能把基础模型的生成与推理优势,翻译成标准化、可验证、可交付的产业能力。基础模型叠加智能体,正成为AI赋能千行百业的核心范式。 梅涛进一步点破了一个现实困境:在复杂任务面前,单个智能体存在明显的能力 天花板,跨链路、高精度的创作任务它独木难支,唯有让多个智能体像专业团队那样分工协作,才能啃下真正的产业硬骨头。而要让这支智能体集群稳定、高效、有序地运转,一套名为AgentOS的智能体操作系统是绕不开的地基。为此,智象自研了HD-AgentOS,用资源层、系统层、能力层三层耦合架构撑起整套产业落地体系:资源层提供智能体可调用的基础资源与原子能力,是执行的底座;系统层包揽全流程运维、风控、监控与安全治理;能力层则把模型、工具、知识和流程封装成领域技能。有了这套操作系统,多智能体协作便能突破单打独斗的局限,组建成一支可感知、会推理、可执行、能进化的专业团队。 vivago R1正是架在这套核心技术之上的产物,也是全球首个具备无限时长视频生成与编辑能力的多模态创作智能体。它的出现,标志着AI在创意生产领域的一次范式转移——从只会辅助生成单点素材,进化为能够自主规划、调度并完成长链路创作的智能搭子。智象把它的核心优势概括为长、长、稳三个字,精准对准行业长期存在的时长受限、逻辑混乱、效果不稳三道痛点。 第一 处长,是无限时长、全场景无限制适配。当下主流AI视频产品大多被锁在15到30秒的短镜头里,根本喂不饱长周期商业创作。vivago R1直接掀翻了这道时长壁垒,支持任意时长的视频连续、连贯生成,从短剧、专题片、品牌宣传片到影视成片,全品类长周期创作场景都能接住,把行业长视频创作的空白补上了。第二处长,是长任务思考,保障创作逻辑连贯统一。长视频从来不是短镜头的简单拼接,它需要完整的叙事逻辑、统一的画面风格、稳定的人物IP与场景设定。vivago R1具备长任务思考能力,能自主完成精细化逻辑构思、镜头排布与风格校准,把画面跳变、人设崩塌、叙事断层、风格割裂这些老毛病一一按住。第三处的稳,是高稳定生成,赋能商业规模化交付。传统大模型带着概率性输出偏差,成片可用率低,企业调试成本居高不下;依托AgentOS的全流程调度与治理,vivago R1把创作全链路变成可控可校准,将内容有效可用成功率提升到85%,远高于行业平均,反复修改调试的时间与人力被大幅砍掉,生成内容能直接走进商业制作、品牌传播与市场化交付。 这种能力在社媒创作、商业营销这类持续性长链路场景里尤其见功力。一个看似简单的分镜生成,既要依据剧本画出画面,又要吃透镜头语言、叙事节奏、情绪表达,甚至要分清短视频vlog、短剧、商品素材短片对分镜的差异化要求——这种深度的行业理解,绝不是直接调一个大模型API就能交差的。vivago R1用多智能体协同机制,把理解任务、构思故事线、创作分镜脚本、生成核心素材、生成超长视频这条完整链路做了原子化封装与专业化调度,让叙事、镜头、角色、风格、声音和审美有机统一,真正完成了从单点工具到全链路创作系统的跨越。 产品之外,智象在WAIC期间还落下了两步生态大棋。它与飞捷科思等创新企业和 顶尖 科研机构共同发起物理智能创新联合体倡议,意在聚拢产学研多方力量,共筑原生全模态世界模型的产业协同新格局。与此同时,智象与中科类脑等机构达成战略合作,签约组建一带一路Token出海联盟,以Token无国界、AI无孤岛为核心理念,推动中国原生全模态AI能力跨越山海,连接全球智能新基建,助力和共建一带一路国家和地区的智能化升级与数字生态互联。 行业的竞争维度早已全面升维。过去那场单一的大模型参数竞赛正逐步归于理性,取而代之的是基础模型加智能体系统的全方位生态较量。智象打造的1+1+3商业模式,正是对这道新命题的回应——在底座模型上保持全球领先竞争力,在用户最渴求智能释放的垂直赛道里扎到最深。从vivago R1的发布到双联盟布局,智象以多点突破的方式,在这场规模空前的WAIC上集中展示了 最新 成果,也为AI从工具演进为智能伙伴探了一次路。接下来,它要持续推动多模态技术向原生全模态、向世界模型深度进阶,用硬核创新与全球化协同,把人工智能产业推入规模化、商业化的新时段。
别再数Token了:OpenAI甩出AI时代记分卡,用"有用智能每美元"给CFO算清ROI
当全世界的首席财务官都在追问同一个问题时,OpenAI决定亲自下场把这笔账算明白:我们从人工智能的投入里,到底换回了多少价值?过去十几年,软件行业习惯了用采用率衡量成败——卖了多少席位、有多少活跃用户、续费了多少许可证。但到了AI这里,这套尺子失灵了。真正的刻度,应该是模型到底干完了多少活。 OpenAI在7月17日发布的这篇长文里,把企业 领导者 面对的核心经济命题摊开:人工智能完成的工作,其价值增长是否快过了生产它的成本增长?要回答这个问题,光看每token成本远远不够。一个便宜的模型,token单价或许低,但为了得到好结果,可能要反复试错、耗费更多时间、叠加更多人工审核;一个昂贵的模型,token单价高,却可能一次就把任务做对。真正的成本,是产出一个成功结果的完整代价,再拿它去对照这个成果创造的价值。 于是OpenAI给出了AI时代的 终极 记分卡——有用智能每美元。这个指标要回答四件事:人工智能是否在完成有意义的工作?每一项成功任务的成本是多少?人们能否信赖它的结果?随着用量增长,每投入一美元的人工智能,是否创造了更多价值? 先说 第一 项,完成了多少有用工作。价值只在token变成人们能直接使用的实际产出时才被创造出来。模型越强,能扛下的任务就越长越复杂:它开始保持上下文、做多步推理、跨工具协作,并在过程中不断调整适应。最务实的切口,是先锁定一个具体工作流,定义清楚什么叫完成,然后在工作实际发生的系统里去度量这个结果。对支持团队,完成意味着一个客户问题被解决;对工程团队,是一笔通过测试的代码变更;对法务团队,是一份被准确且及时审查的合同。OpenAI举了一个财务团队为预测评审做准备的例子:在最终决策之前,要去找 最新 预测、把数据导进Excel或Sheets、识别变化、核对标签页、重建幻灯片、检查所有数字是否吻合,这一连串杂活大部分都可以交给ChatGPT Work,团队因此腾出精力去想真正重要的事——发生了什么变化、为什么、下一步该怎么办。这就是每一美元在实践里换来的有用智能。 第二项,一个成功任务实际花了多少钱。AI任务的成本天差地别,一句快速回答消耗的计算极少,而编码、研究、财务类工作流往往涉及深度推理、工具调用和大量操作,它们吃更多算力,也创造更大价值。在模型层面,单次成功任务的成本由价格、实际用掉的计算量以及得出正确结果的概率共同决定;对企业而言,总成本还要叠上员工时间、人工审核、重试和返工。算法很简单:把完成工作的总成本加起来,除以达到质量标准的任务数量。这正是每token 最低 价未必换来每结果 最低 成本的原因——即使对常规请求,如果一个前沿模型能一次给对答案,省下的重试、延迟、审核和总计算量,反而可能让它成为最划算的选择。 OpenAI刚发布的GPT-5.6正是按这个逻辑设计的三个层级:Sol是旗舰,Terra在性能与成本间取平衡,Luna最快也最省。这套分层给了客户优化公式的起点,但OpenAI强调,最终该用哪档模型,要看整笔任务的经济性——高吞吐流程用Luna,需要深度时用Terra,当更强推理能以更少尝试换来 最好 结果时用Sol。训练GPT-5.6时,OpenAI的目标就是让每个token产出更多有用成果:在Artificial Analysis编程智能体指数上,开启 最大 推理的GPT-5.6Sol创下新的 最优 水平,同时比另一款领先模型少用了54%的输出token;在DeepSWE v1.1长周期工程任务里,GPT-5.6Sol达到72.7%的新高,高于Claude Fable5的69.9%,预估API成本还降低了36.2%。每一代模型都该在两方面同时进步——更高效率让旧任务更便宜,更强能力让全新类型的工作成为可能。 第三项,AI正确完成工作的频率有多高,也就是可靠性。人工智能的采用通常会分阶段深化:先是辅助起草,接着在工具和数据之间找上下文、做推理,再往后开始主动采取行动、处理异常、跑完整个工作流,而人只在必要时给出判断和控制。每一步都创造更多价值,也对系统提出更高要求。可靠性本身就是钱——当结果准确、来源可靠、前后一致且能恰当地升级处理,人们花在审查、纠正和返工上的时间就少了,成功任务的成本随之降低,组织也更有底气把AI用进更重要的流程。 OpenAI建议团队追踪三种结果来衡量这一点:可直接使用、需要修正、需要升级处理,这比单纯的模型准确率更能说明AI是否真的减少了完成项目所需的工作量。可靠性还需要清晰的边界:在AI从起草走向行动之前,组织必须定义系统能访问哪些数据、可以使用或更改哪些系统、何时需要人工审查或批准某个操作。安全、保障、隐私和控制构筑了深度使用的基础,而ChatGPT Work正是建立在ChatGPT Enterprise的安全、合规与工作区管理之上,让组织在保持监督的同时,给AI接入更有价值的流程。能力带来 第一 次使用,可靠性才让AI成为完成工作的组成部分。 第四项,随着使用量增长,每一美元AI投入能否完成更多工作。企业可以长期追踪同一工作流来度量:统计达到质量标准的任务数、完成它们的总成本、以及每项成功任务的成本,如果完成的工作量增长快过总成本、质量还保持不变或提升,那么每一美元就产出了更多价值。算力处于这个等式的核心——它驱动着研究,也驱动着AI完成的每一项任务,决定了产品质量、速度、可靠性、可用性和成本。训练算力构筑未来能力,推理算力交付当下的价值,两者最终都要转化为更好的客户成果。 更优的模型、更高效的推理、专用硬件、更高利用率、更聪明的路由和更强的产品设计,都能抬升算力的回报。客户从体感上接住这些改进:答案更准、响应更快、修正更少、产品更可靠、完成所需工作的成本更低。这些收益会自我累积——更好的基础设施加速研究,研究催生更强更高效的模型,模型改进产品,产品推动采用、学习与收入增长,而这又反过来支撑对下一代研究、算力、部署和安全的持续投入。OpenAI用一个统一的智能平台把所有这些要素收拢:用户通过ChatGPT和ChatGPT Work使用,开发者通过Codex和API构建,企业把它部署进真实工作发生的系统,任何一层改进,所有产品和客户都随之受益。 把四项指标合在一起,这张记分卡其实在回答一件事:每单位成本换来的有用智能,是否在持续上升。有用产出告诉我们AI能产生什么,每项成功任务的成本告诉我们达成结果要付什么,可靠性告诉我们人们可以放心使用多少成果,规模化价值则告诉我们随着时间推移,每一美元和每一单位算力是否实现了更多成效。OpenAI把它自己的职责,归结为让这个等式在每一代模型上都变得更好——更强的模型、更快更可靠的结果,以及为客户真实所需的工作压低的成本。当AI开始用每美元的有用智能说话,而不是用token的流水账,价值这回事,才算真正被算清。
Netflix5.87亿美元收购本·阿弗莱克AI电影制作公司InterPositive
Netflix近日在提交的监管文件中披露,公司已以5.87亿美元现金完成对AI电影制作初创公司InterPositive的收购。该交易此前于3月宣布,但双方当时并未公布具体金额,彭博社此前报道称交易规模可能接近6亿美元。 InterPositive由演员兼导演本·阿弗莱克共同创立,专注于利用人工智能技术辅助影视制作流程。阿弗莱克表示,公司希望通过AI工具“保护人类创造力的力量”,帮助电影制作团队在后期制作阶段提升效率,尤其是在解决现实拍摄过程中的素材缺失、背景替换以及光线调整等问题方面。 根据Netflix此前公布的信息,InterPositive团队将在收购后整体加入Netflix,阿弗莱克将担任 高级 顾问,继续参与相关技术与创意方向的推进。 与此同时,Netflix在 最新 财报中透露,目前已有约300部影片采用生成式人工智能技术。此次收购进一步显示,Netflix正在加速布局AI驱动的影视生产体系,通过技术手段优化内容制作流程,同时探索人工智能与传统影视创作之间的融合路径。 随着生成式AI在视频生成、后期制作、 特效 处理等环节持续成熟,影视行业正迎来制作模式的深层调整,AI辅助创作能力也逐渐成为流媒体平台竞争的重要方向。
BestBlogs 早报 · 07-20 # Vidu S1 / Agent 云 / Netfl
BestBlogs 早报 · 07-20 # Vidu S1 / Agent 云 / Netflix / Qwen3.8 / 政府 AI 治理 [1] ★ 精讲|Netflix CPTO Elizabeth Stone 谈 AI 与产品、技术角色的未来 [视频] Netflix 技术负责人 Elizabeth Stone 的判断很克制:AI 加快原型和生产流程,却没有替代品味、责任与创作者选择。她把真正的准备工作落到可信数据、访问控制、安全护栏和人才密度,给管理者一套比追逐模型更新更耐用的组织检查表。 来源:Lenny's Podcast [2] ★ 精讲|Vidu S1 如何让视频生成跨过实时门槛 [播客] Vidu S1 把视频扩散推理压到约 4 步,并从算子、模型到集群服务逐层优化,在消费级 GPU 上实现 540P、25–42 FPS 的持续生成。文章的价值不只在速度数字,更在于拆清实时视频从模型能力走向可部署系统时,计算、显存与调度瓶颈如何转移。 来源:十字路口 Crossing [3] ★ 精讲|对话 PPIO 姚欣:Token 工厂的第一客户不再是人,而是 Agent PPIO 把 Agent 云拆成模型网关、上下文工程、沙箱与 Harness 四层:前者处理多模型路由、缓存和故障切换,后者为代码执行提供隔离环境。文中的降本增效数据来自公司披露,仍需外部验证;更值得关注的是,云基础设施正围绕 Agent 的长任务形态重构。 来源:智东西 [4] Qwen3.8 发布:拥有 2.4T 参数(官方) Qwen 宣布推出 Qwen3.8,这是一款拥有 2.4T 参数的模型,性能媲美前沿模型,目前预览版已开放。 来源:Qwen(@Alibaba_Qwen) [5] SK 海力士崛起史:一个荒诞又狗血的财阀故事,如何卡住全球 AI 的脖子 本文梳理了 SK 海力士从纺织起家到垄断 HBM 内存、助力 AI 算力的崛起历程,并分析其财阀背景、技术押注及市场影响。 来源:硅谷 101 [6] Netflix 如何构建 GenPage:一个用于构建个性化主页的单一 GenAI 模型 Netflix 的 GenPage 用单一的生成模型取代了多阶段推荐流水线,直接利用用户上下文作为提示词来创建个性化主页,实现了更高的用户参与度,并将端到端服务延迟降低了 20%。 来源:InfoQ [7] 用 Claude 重写 SQL 解析器,性能暴涨 70 倍:程序员做的不是写代码,而是搭建验证闭环 本文详述了作者如何利用多个并行 Claude Code 会话,通过测试驱动开发与基于属性的测试,将 PostHog 的 SQL 解析器用 Rust 重写,最终在生产环境中实现 454 倍性能提升的完整过程。 来源:AI 前线 [8] Demo 跑通了,上线就翻车?Java Agent 生产的那些坑,我们帮你填了 Java Agent 在生产环境落地的关键难点在于运行时的稳定性、记忆管理、工具溢出保护与可观测性,本文通过 Spring‑Ai‑Trip 框架系统性填补这些空白。 来源:携程技术 [9] 自主科学任务智能体如何突破研究瓶颈 [视频] Sina Shahandeh 解释了自主编码智能体为何会在开放式科学任务中陷入停滞,并提出以显式层级脚手架、多模态审查与推理模型批评来形成更强假设、维持实验循环。 来源:AI Engineer [10] 一个关于政府 AI 合同的红线与监督框架 — LessWrong 一位前谷歌 DeepMind 工程师提出了一个详细的治理框架,包含两条红线(人类对瞄准目标的控制;禁止无目标的 AI 画像分析)和一个审查机构,以在政府 AI 合同中强制执行透明度。 来源:LessWrong --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
LLM作为教练:面向不可验证任务的体验式学习
Reinforcement learning (RL) on open-ended tasks compresses an LLM's rubric-based evaluation into a scalar reward, discarding rich textual feedback and conflating responses with distinct quality profiles. We propose Experiential Learning (EL), which repurposes the feedback model from an LLM-as-a-Judge into an LLM-as-a-Coach. The coach distills its assessment of each on-policy response into transferable experiential knowledge, which conditions a teacher model and is internalized by the policy through on-policy context distillation. Compared with scalar rewards, this higher-bandwidth feedback channel provides dense supervision and preserves fine-grained preferences among high-quality responses. Across two policy families, with feedback from the policy itself or a proprietary model, EL consistently outperforms rubric-based RL on held-out and unseen open-ended tasks. Notably, EL generalizes better beyond the training distribution, and mitigates reward hacking. These findings establish experiential knowledge as a richer and more generalizable learning signal for post-training on non-verifiable tasks.
分布偏移下用于忠实生成的令牌级离策略学习
We propose Token-Level Off-Policy Labeling (TOPL), an off-policy training paradigm that reframes post-training as a token-level correctness prediction task. Our key intuition is that by training the model to distinguish good and bad tokens in a response, we naturally guide the model towards generating good tokens, while avoiding the pitfalls that come with directly training the model to generate off-policy tokens. Experiments on document summarization tasks show that TOPL achieves strong out-of-distribution generalization across 11 datasets against a diverse set of sequence-level and token-level baselines. We further demonstrate that TOPL transfers effectively to machine translation, suggesting that its benefits generalize across different faithful generation tasks. Through ablation studies, we confirm that our token-level learning signal is critical to good performance; sequence-level analogues do not confer similar benefits. Finally, we show that TOPL induces interpretable model updates: the LoRA adapters learned through TOPL function as linear classification heads and steering vectors.
不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半
关注前沿科技 2026-07-19 18:18 北京 奇异摩尔亮相WAIC 允中 发自 凹非寺 量子位 | 公众号 QbitAI 7月17日至20日,2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)在上海世博、张江、西岸“三地四馆”同步启幕。 作为行业领先的AI网络全栈式互联产品及解决方案提供商, 奇异摩尔 首次亮相WAIC 2026。 大会期间,公司成功举办“智联为擎 合一共进——AI网络前沿生态论坛”,为AI网络互联生态的协同创新搭建了深度对话平台。 上海人工智能实验室、香港科技大学(广州)、商汤科技、壁仞科技、九章云极、曦望科技、科华云、图灵量子、图灵芯擎等知名研究机构和企业,以及多家产业链上下游生态伙伴与行业嘉宾齐聚一堂。 在本次论坛上,国产超节点生态共建倡议行动正式启动,并重磅发布《共封装光学(CPO)技术白皮书》,进一步彰显奇异摩尔推动产业协同的前瞻布局。 此外, 奇异摩尔还携国产化超节点互联全栈解决方案、与壁仞科技联合打造的国产GPU直通国产RDMA网卡通信技术IBGDA Demo以及下一代光互联合作成果等核心技术及产品集中亮相,全面展示公司在算力网络互联领域的技术突破与生态成果,向全球观众呈现了中国AI算力生态的自主创新力量。 奇异摩尔创始人兼董事长田陌晨 在论坛致辞中表示,连片成林,方能御风守固。正是基于对“连片成林”的深刻认知, 奇异摩尔自创立以来,始终致力于成为AI网络互联生态的积极建设者与连接者。我们深知,网络互联是打破算力孤岛、让单个强点连成高效系统的关键脉络。 没有哪一家企业能够独自走完从底层芯片到顶层应用的全链条;只有把生态做大,企业才能更强。 全国产化超节点互联全栈方案首次亮相,打通系统级协同脉络 当前国产算力面临的核心困境,并非单芯片性能的落后,而是“单点强、系统弱”的结构性失衡。 各家芯片性能虽不断突破,但片内、片间、网间、集群间各层互联各成体系,缺乏统一的全栈视角与系统级协同。 这种长期割裂直接导致系统级性能无法随芯片数量的增加而线性释放,算力资源被严重碎片化。 在以互联为核心的超节点时代,该短板会被无限放大。 奇异摩尔长期深耕AI网络互联领域,目前产品布局覆盖从Scale-Out网间互联、Scale-Up超节点XPU间互联到下一代光互联的全栈式解决方案。 针对上述行业现状,在本届WAIC上,奇异摩尔国产化超节点互联全栈解决方案 首次亮相,并以超节点机柜直观呈现国产AI算力基础设施从“单点芯片突破”迈向“系统级协同优化”的跨越式发展,为大规模国产AI算力集群建设提供了自主可控的全栈互联底座。 奇异摩尔联合创始人兼产品及解决方案副总裁祝俊东 指出, 这套全栈方案的核心价值,在于为国产AI算力提供了一套可演进、可协同、不绑定的系统级基础设施。芯片厂商可基于统一底座灵活构建超节点系统,上层应用可无缝获得横向扩展能力,产业生态得以从各自为战走向合力突围。 国产算力正处关键历史节点,互联已不再是配角,而是决定系统整体效能的核心命脉。奇异摩尔愿以开放、高效的全栈互联技术,为国产AI产业铺就通往未来的路。 IBGDA DEMO:国产GPU与RDMA网卡的深度协同 前述全栈方案覆盖了从片内互联到网间互联的多个层面,而其中一项最具实战意义的技术验证,便是 国产GPU与国产RDMA网卡之间的直连通信——这正是本次奇异摩尔与壁仞科技联合展示的IBGDA解决方案。 在MoE模型的典型训练或推理中,专家并行通信包含两个核心阶段 (Dispatch和Combine),每个阶段都涉及海量的小粒度数据交换。 传统跨节点通信中,GPU须经由CPU中转指令,由此产生额外延迟与CPU开销。 IBGDA技术通过绕过CPU处理环节,显著降低指令中转等待时间,充分释放GPU在并行计算中海量线程的吞吐优势,在All-to-All通信场景中实现吞吐提升与延迟压降的双重收益。 在国际方案与国产方案的对标中,英伟达凭借其GPU与ConnectX系列网卡的深度协同,率先实现了IBGDA方案,为大规模AI推理场景提供了成熟的延迟敏感型通信能力。 而国产集群要实现同等能力,国产化GPU需先满足对类NVSHMEM编程及最新NCCL通信库,以及DeepEP等集合通信库的支持,并与国产RDMA网卡在软硬件层面完成适配,方能实现GPU直通网卡的高效通信。 然而,目前国产GPU对IBGDA的支持主要停留在与英伟达网卡的适配上, 国产GPU直通 国产RDMA网卡的规模化落地案例仍相对罕见,这一环节成为制约国产化集群通信效率提升的短板。 这一局面正在被打破。奇异摩尔推出的单通道400G RDMA ASIC引擎,基于Kiwi SNIC 800G平台架构设计,已完成软硬件协同开发,兼容专为MoE模型优化的集合通信库 (对标DeepEP),并原生支持IBGDA (GPU直接发起通信) 机制。 本次WAIC大会上,奇异摩尔携手壁仞科技,联合展示了国产GPU直通国产RDMA网卡的IBGDA解决方案。 该IBGDA Demo测试平台对标英伟达IBGDA测试数据,实测结果达到相应水平。 测试结果表明:IBGDA相较传统IBRC在小包、高频、强同步场景下呈现出代际优势。 单次小消息带宽显著跃升,原始小包发送及合并发送的吞吐量均实现质的跨越;All-to-All通信延迟大幅缩短,接近翻倍提升; 尤为关键的是,传统方案小消息时延,远超大消息的“小包惩罚”被彻底消除。 值得强调的是,该方案基于开放的以太网生态构建,继承以太网部署灵活、成本可控优势的同时,为国产算力集群提供了一个兼具高性能与自主性的Scale-Out网络选择。 这一联合演示极具含金量,通过软硬件的深度协同,绕过繁琐的协议转换,大幅降低通信延迟,显著提升AI推理集群的整体处理效率。 这是对“国产芯+国产网”最佳实践的生动诠释,更以实测数据证明了国产算力生态已具备底层互通、系统级协同优化的实战能力。 布局OSU超节点互联芯粒,锚定下一代光互联技术路线 本次论坛的另一大核心亮点,是《共封装光学(CPO)技术白皮书》(以下简称“白皮书”)的发布。 《白皮书》由香港科技大学(广州)发起,奇异摩尔携手曦望Sunrise、壁仞科技、图灵量子、奇点光子等单位共同参与编写,凝聚了产学研各界的集体智慧。 《白皮书》系统梳理了CPO的技术路径、产业挑战与未来演进方向,为国内光互连技术标准化落地与规模化、产业化发展提供权威指引与实践参考。 面向未来,光互联正成为下一代超节点系统的基石。 传统电互联受限于铜缆物理极限,带宽密度与能耗已难以支撑下一代算力需求;而光互联在Scale-Up空间内几乎没有通信距离焦虑。 当前主流光互联以可插拔光模块为主,光引擎仍停留在主板边缘。 为满足Scale-Up对低功耗、低延迟的要求,光引擎必须向计算核心持续收敛,由此形成清晰的演进路径:可插拔光模块 → NPO → CPO → OIO,最终目标是“光内生”——将光互联功能直接集成于计算芯片内部。 路径越短,收益不止于物理距离的缩短。更近的互联可省去DSP,有效降低延迟,同时简化系统设计、降低功耗与成本,最终提升整体算力利用率。 CPO技术能够有效缓解单节点I/O能力对系统扩展的制约,突破铜互连的物理极限。 然而,该技术主要解决的是物理层的高速数据传输问题;在协议层,Scale-Up复杂的网络拓扑与流控机制仍对计算核心造成巨大负担。 为组建更大规模的Scale-Up网络,计算核心不得不牺牲相当一部分芯片面积和计算资源用于处理网络事务。 互联I/O芯粒的出现恰好补齐了这一关键短板,在智算集群的高性能计算芯片中,I/O芯粒扮演着语义对齐与协议承载的核心接口角色。 奇异摩尔基于在网络互连及芯粒技术领域的长期积累,已前瞻性地布局——OSU(Optical Scale-Up)IO芯粒产品与未来CPO迭代方案的融合路径。
面向LLM后训练的蒸馏强化学习
Large language model (LLM) post-training is essential for improving reasoning, adaptation, and alignment. Existing methods mainly follow two paradigms: reinforcement learning (RL) and on-policy distillation (OPD). However, RL relies on coarse-grained outcome supervision, resulting in difficult credit assignment and limited capability to acquire new knowledge. OPD, meanwhile, unconditionally matches teacher logits through KL divergence, which creates a dilemma: similar teachers provide little new knowledge, while substantially different teachers often yield ineffective guidance, largely restricting OPD to within-family distillation. We propose Distilled Reinforcement Learning (Distilled RL), which integrates teacher supervision into the RL objective to provide fine-grained guidance, selectively transfer new knowledge and avoid unconditional imitation. Distilled RL contains three components: reverse importance sampling with clipping, negative sample reset, and sequence-level geometric normalization. Through a concise and interpretable case study, we demonstrate that Distilled RL can effectively transfer previously unavailable knowledge from a teacher model to a student model. Extensive experiments across both within-family and cross-family distillation settings show that Distilled RL substantially outperforms standard RL and OPD in terms of both pass@1 and pass@k. Our code is available at
How Canada uses Claude: Findings from the Anthropic Economic Index
Le français suit. Key findings Based on the latest release of the Anthropic Economic Index, Canada is at the forefront of Claude adoption. Canada represents 2.6% of global Claude.ai traffic and ranks 8th overall by total volume. Usage per capita is more than four times higher than would be expected given the size of its population. Canada’s high adoption rate is generally consistent with its high-income economy, but still stands out within its peer group. Among the top ten countries that collectively represent more than half of all usage, Canada is second only to the United States in usage per capita. Within Canada, adoption is regionally concentrated. Ontario accounts for 43.9% of conversations. Together with Quebec, British Columbia, and Alberta, the four largest provinces account for roughly 94% of national usage. Per capita, British Columbia leads at 1.4x more than expected based on population, followed by Ontario at 1.1x; every other province has below-parity rates of adoption, with Newfoundland and Labrador at 0.2x. In contrast to global, cross-country patterns, provincial income per capita does not appear to explain the gap. Instead, industrial composition appears more important: provinces with large professional, scientific, and technical services sectors use Claude the most. This aligns with other evidence that model capabilities matched to workforce composition determine overall adoption levels within high-income countries. Usage patterns in Canada are largely uncorrelated with adoption rates: Work accounts for 34–40% of conversations in every province, coursework for 13–18%, and personal use for 44–51%. We find evidence that specific use cases coincide with local economic characteristics. Translation requests track public administration employment shares across provinces, likely reflecting Canada's policy of official bilingualism in federal services and communications: New Brunswick, Nova Scotia, and Quebec have both the highest rates of public administration employment and the largest shares of conversations devoted to translation. Document translation is also the most distinctive Canadian use case relative to Anglosphere peers. More generally, Canadian usage tilts toward academic and early-career usage: academic coursework, coding assistance, and resume drafting are all overrepresented, while professional communication and everyday personal tasks are underrepresented. Canada is at the forefront of Claude adoption Adoption of Claude is high in Canada. Based on a sample of Claude.ai conversations in February 2026, 2.6% of global traffic is in Canada. Adjusting for population, its Anthropic AI Usage Index (AUI) is 4.4, which implies that usage per capita is more than four times higher than would be expected based on its working-age population. Among the top ten countries that lead in terms of overall Claude usage volume, Canada has the second-highest AUI, just behind the United States (Figure 1). Figure 1: Usage share and per capita adoption among top ten countries by global Claude.ai use Bars show each country’s share (left panel) and the Anthropic AI Usage Index (right panel) based on 1M conversations sampled from Claude.ai in February 2026. Canada highlighted in blue. The Anthropic AI Usage Index (AUI) measures whether Claude usage is over- or under-represented in a country relative to its working age population. Canada accounts for 2.6% of global Claude.ai consumer use, ranking eighth globally, and second by AUI. Sources: Anthropic Economic Index, February 2026; World Bank. In part, this reflects the fact that Canada is a high-income country. Among advanced economies, as defined by the IMF, there is a clear link between usage per capita and GDP per working-age capita. But Canada’s adoption exceeds what would be expected based on its income (Figure 2). In this sense, Canada appears further along on its AI adoption curve as compared to peer countries, perhaps reflecting its highly educated workforce and proximity to the US technology frontier. Figure 2: Anthropic AI Usage Index (AUI) and GDP per working-age capita This plot shows the bivariate relationship between each country’s AUI and GDP per working-age person among IMF advanced economies with at least 200 conversations in our sample. The dashed line shows the line of best fit. Canada highlighted in blue. Sources: Anthropic Economic Index, February 2026; IMF; World Bank. Within Canada, adoption is concentrated and tracks workforce composition Just as global adoption of Claude is disproportionately concentrated among a small number of countries, usage within Canada is unevenly distributed across provinces
Claude plays robotics
Shmuel Berman, Michael Ilie, Jia Deng, and Daniel Freeman Do language models’ strengths transfer to robotics, a domain which requires the synthesis of logical skills and precise 3D understanding? Can a model perceive a scene, understand a particular robot’s state, and issue actions that reliably effect change in the physical world? We ran tests to find out. We gave several language models control over a range of robot bodies—including classic control toys, a simulated quadruped and humanoid, a robotic arm, and a real Unitree Go2 (the quadruped robot of Project Fetch ). We gave the models a range of ways to control them, which varied in their abstraction (that is, how “high-level” their instructions are): from directly commanding motor torques (at the least abstract end), to writing controller code, to training a controller from scratch with reinforcement learning, to providing high-level steering instructions to a pretrained robot policy (a separate neural network that turns high-level commands into coordinated joint movements). We tested models’ performance in three areas: on classic control problems (like balancing a pendulum), locomotion and navigation (getting legged robots to balance, walk, and move through space), and manipulation (using a robotic arm to grasp and move objects). Models are getting better at robotics quickly, but we found that how capable they are depends heavily on how they are connected to the robot—which of the control methods they used. When they must drive the joints themselves they mostly fail. But when they supervise a pretrained controller or use simple orientation tools, they can complete real navigation and manipulation tasks. Some forms of embodiment remain unwieldy and difficult to control, but newer models, especially, are substantially stronger at adjusting their strategies and converting image and sensory understanding into appropriate actions across domains. This has important implications for the safe development and deployment of language models. Today’s frontier models cannot control humanoid robots without a pretrained policy, but newer models have made real gains in direct manipulation and high-level policy control across the humanoid and quadruped embodiments we tested. We expect future models to be even better. Put concretely: a general-purpose chat model with no robotics training can already, on a good run, write and download its own tools to slowly walk a quadruped through a maze or pick a plate off a counter and set it on a stove, and the gap in reliability is closing with each model generation. Composite score on Embody (our benchmark suite) by model, stacked by control interface. The composite is a normalized average across every robot body ("embodiment") and task in the suite except for high-level locomotion; higher bars mean broader physical competence. Summary of findings A model's robotics score depends as much on the robot body and the control interface as on the model itself. The same model can look weak or strong depending on whether it is setting motor torques directly, writing a Python controller, supervising a pretrained policy, or training its own policy with reinforcement learning—each of which is a different way of the model completing the same task. For the most challenging bodies to control (the humanoid in particular), today's models only get traction at the higher-abstraction interfaces, in which a pretrained policy handles the low-level physics. Models are improving at robotics, but unevenly. The most consistent performance improvements between model generations are on the high-level interfaces. Direct low-level control is also improving, but much less consistently: some new models clearly improve over their predecessors, but others don’t. On locomotion tasks, frontier models can now perform limited but meaningful whole-body control. Newer models make progress on low level control quadruped standing, balancing, and walking—and show weaker but measurable gains on humanoid balancing. Using pretrained policies and perception tools, they can even navigate simple environments. However, models still fail at tasks that require stable spatial memory, self-localization, or long open-loop plans. With low-level manipulation methods, models are beginning to produce useful local physical behavior, even though full task success remains rare. Newer models are better at reaching objects, making contact, and grasping. However, they only complete the full task a small percentage of the time (from 0 to 5.5%). With high-level manipulation methods, newer models are more successful when using pretrained policies. Vision-language-action (VLA) scaffolds—pretrained policies that map camera images and an instruction directly to robot-arm motions—raise models’ manipulation performance far above direct control. Newer models are also becoming increasingly g
非程序员现在有了真实用户,如何证明用户 A 无法读取用户 B 的数据?
I vibe-coded a tiny SaaS for about a month with basically zero software background. It works well enough that real users are poking at it, which is exactly when the fun left the room. a dev friend asked one question that ruined my evening. Can user A change an ID in a request and see user B's records. I had no answer. Claude generated a lot of the app and I nodded along becuase the UI looked right. Tenant isolation is not a UI feeling. It is route checks, database policy, ownership, and all the boring stuff I skipped. My current pre-launch panic list is pretty small. two test users, ID swap every route, secrets not in frontend code, sessions that expire, admin routes that normal users cant call, logs that do not dump private data. That question also made me rethink how I built the app in the first place. I had been treating auth, database rules, and server functions as separate Claude conversations, so I was basically inventing permissions one prompt at a time. I started comparing that setup with Enter Pro I used before, where those pieces sit closer together in the same build flow,offered me a clear line of thinking. What I am trying to figure out is whether keeping everything together actually makes the access rules easier to inspect, because a cleaner builder still does not prove tenant isolation For no-code founders, what do you check before real users touch customer data submitted by /u/Comi9689 [link] [comments]
BestBlogs 早报 · 07-19 # 开放权重 / LLM 代码安全 / 具身智能 / OpenVM / Kimi K3 [1] ★ 精讲|开源 AI 现状 — V1.0 · 2026 年 7 月 Mozilla 汇集开发者调...
BestBlogs 早报 · 07-19 # 开放权重 / LLM 代码安全 / 具身智能 / OpenVM / Kimi K3 [1] ★ 精讲|开源 AI 现状 — V1.0 · 2026 年 7 月 Mozilla 汇集开发者调查、市场与基准数据,指出开放权重在编码等任务已接近闭源模型,但生产落地率仍落后,瓶颈集中在部署、合规与维护。文章进一步把竞争焦点推向 Agent harness 的权限、记忆和治理层,帮助读者判断自托管真正需要补齐的工程能力。 来源:Hacker News [2] ★ 精讲|腾讯发布多款具身智能基座模型与智能体,钛螺丝平台迎来全面升级 腾讯一次发布三款具身基座模型与两个智能体,尝试打通感知、规划、动作和持续反馈。官方披露 HyVLA-0.5 已进入日化工厂实测,作业成功率高于 95%、节拍快于 6 秒/件;读者可借此观察具身 AI 从单模型评测走向软硬协同部署的路径。 来源:腾讯技术工程 [3] ★ 精讲|用 LLM 构建源代码安全防护体系 [视频] Anthropic 的 Eugene Yan 将 LLM 代码审计拆成威胁建模、隔离沙箱、发现、独立验证、风险分级和修复闭环。关键提醒是,模型扩大了扫描范围,也把稀缺资源转移到工程师的验证与处置时间;读者能据此设计从交互式试点走向自动化的安全流程。 来源:AI Engineer [4] AI 遇上密码学 2:AI 在 OpenVM 的 zkVM 中发现了什么 一名 AI 审计员在 OpenVM 的 pairing guest 库中发现了一个严重的健全性漏洞,该漏洞通过忽略缩放因子的子域检查,允许伪造任何配对等式。 来源:Hacker News [5] IsoDDE:超越 AlphaFold 的全新药设计引擎 — Isomorphic Labs Isomorphic Labs 推出 IsoDDE,一款统一的 AI 药物设计引擎,在新型蛋白-配体预测上精度超过 AlphaFold 3 两倍以上,并在结合亲和力预测上超越基于物理的方法。 来源:Hacker News [6] AI 手机的真问题从来不是智能,是信任 文章通过阶跃 STEPX Neo 的演示,深入分析 AI 手机的核心瓶颈在于信任而非智能,并提出系统重构与分级治理的解决路径。 来源:硅星人 Pro [7] AI 每天生产 1000 万首新歌,Spotify 等平台最终会消亡丨 100 个 AI 创业者 ACE Studio 创始人郭靖讲述 AI 音乐工具的商业化路径与未来愿景,认为 AI 带来的音乐供给爆发将摧毁 Spotify 等流媒体平台的根基,下一代音乐平台将是一个懂你的 music agent。 来源:晚点 LatePost [8] Claude Code 是怎么设计出来的:下一代设计师负责什么丨 Dive Club Claude Code 设计负责人 Meaghan Choi 分享如何设计没有传统界面的 AI 产品,核心是让设计从画布扩展到心智模型、行为与组织工作流,并强调在 AI 能执行一切时,设计师的判断力与取舍比以往更重要。 来源:晚点再听 LaterCast [9] 2026,中国芯片为国产模型「托底」丨 WAIC 现场 本文通过 WAIC 2026 现场报道,分析国产芯片、大模型和具身智能的最新进展,指出国产 AI 产业正从拼参数转向重性价比,算力生态壁垒逐步瓦解,产业链上下游形成相互支撑格局。 来源:腾讯科技 [10] 智能体评估差距:企业 AI 组织存在现实对齐问题,而非覆盖问题——而且大多数仍在推向生产环境 VentureBeat 对 157 家企业的调查显示,半数企业已部署通过内部评估但在生产环境中失败的 AI 智能体,尽管只有 5% 完全信任自动化评估,但三分之二的企业正朝着零人工介入部署的方向发展 来源:VentureBeat --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
ChatGPT终于能「搜自己」!攒了近4年的对话,一键翻出
ASI启示录 2026-07-18 18:26 北京 新智元报道 ChatGPT推出快满4年了。 这4年,你跟它聊过多少句话、传过多少张图、开过多少个项目,大概连自己也数不清。 可有一个痛点,你一定记得:想翻回三个月前那次对话,基本得靠运气。 侧边栏那个搜索框约等于摆设,会话一多,搜旧对话近乎不可能。 在OpenAI开发者社区,苦这个旧搜索久矣: 终于能找到那条消息了,为什么拖了这么久;那个老搜索栏,从来就没好用过;会话一多,搜旧对话就变得不可能;翻旧对话简直成了噩梦…… 这不是零星几句抱怨。 ChatGPT什么都能生成,可是你写过的稿、讨论过的代码、生成过的图、囤过的资料,随着对话越堆越多,「翻记录」越来越像大海捞针,侧边栏拉到手酸,也未必找得到三周前那次关键讨论。 而这一次,变了。 7月14日,OpenAI给ChatGPT上线了一套全新的统一搜索,把你在ChatGPT里的所有东西,塞进了一个统一入口:历史聊天、项目、上传的文档、生成的图片,全部能搜。 Web、iOS、Android三端同步,从免费版到企业版,全球所有计划同步开放。 真去把那几年的「存货」翻一遍你就会反应过来:ChatGPT第一次能「搜自己」了。 而这,绝不是补了个搜索框那样简单:它让你的数据更值钱的了。 对于每个人来说,AI时代最值钱的资产,不是模型,而是你自己攒下的这一大堆与AI互动的数据。 一个入口 搜遍你的整个ChatGPT 这次更新,不是让ChatGPT去搜互联网,那是它早就有的功能。 这次搜的,是你自己ChatGPT账号里攒下的东西。 入口就在侧边栏。 搜索范围是四类:聊天、图片、文档、项目,支持按内容类型过滤。 搜到了,点一下直达目标内容,不用再一屏一屏往回划。 这和之前那个ChatGPT Search网页搜索,完全两码事。一个帮你在世界里找信息,一个帮你在自己攒的东西里找信息。 不过这里有一条边界:跨内容搜索只覆盖「上传进ChatGPT、或在Project和Work里生成」的内容。 挂在外面的Google Drive这类已连接应用,暂时搜不到,官方也没给扩展的时间表。 因此,ChatGPT能翻到的,还只是你亲手交给它的那部分。 但光这部分,就已经够多了。 从聊天机器人 到你的个人知识库 一个搜索框,能有多重要? 还真不能小看。它补上的,是ChatGPT做了近4年、却一直缺的那块拼图。 过去这4年,ChatGPT本质上是个「会话工具」。你跟它聊的一切,都锁在一次次孤立的对话里。 聊完那一刻价值最高,过了一周,基本等于沉进海底:你明明记得自己讨论过某个方案,却怎么也捞不回来。 这次更新背后,藏着一个更大的变化:ChatGPT正在从「聊天机器人」,长成一个「个人知识库」。 说得再直白点,它开始长出自己的「文件系统」。 Notion、Obsidian管的是你自己的笔记,谷歌搜索管的是全互联网的信息。 而ChatGPT要接管的,是一片过去从没被专门打理过的地带:你和AI这几年共同生产出来的东西。 它们,才是你在AI时代留下的资产。 模型会一代代换,但你和AI一起攒下的对话、项目、素材,别人拿不走,也复制不来。 而现在,所有这些数据,在 ChatGPT中能够 被你随手翻到,随时调出来用。 你的数据 越搜越重 搜索让你这堆数据更好用,它也让OpenAI手里那份索引更完整、更值钱,但同时也更敏感。 你越能翻到三年前那次对话,这份记录本身就越清晰。可这里有个问题:它的边界,你很难完全掌控。 先看一个多数人没留意的默认设置。 消费级计划(Free、Plus、Pro)里,你的对话默认就会被拿去训练模型,除非你手动钻进Data Controls把它关掉。而多数人,从没点开过那个开关。 再看一件事。 今年1月5日,在纽约时报等媒体起诉OpenAI的版权案里,美国联邦法院维持了一项裁定:强制OpenAI交出2000万条去标识化的ChatGPT对话日志,交给原告一方。 这2000万条,只占它已留存日志的0.5%,后者的量级是「数百亿条」。 OpenAI搬出用户隐私来抗辩,法院没接受,其中一条关键理由是:这些对话,是用户「自愿提交」给OpenAI的。 OpenAI官网回应页:公开反对《纽约时报》调取2000万条用户对话记录的诉求。(图源:OpenAI官网) 更微妙的是,据TechCrunch报道,原告此前指控OpenAI一直谎称自己「搜不了」这些日志。 而现在,OpenAI转手就给每个用户端上了一个「随便搜」的功能。 搜索升级本身没有改动任何隐私政策,官方也没宣布新的数据用途,但它却让你这几年攒下的东西,分量更重了。 你跟它说过的每一句话,既是资产,某些情况下,也可能被翻开、被呈上法庭。 ChatGPT为啥突然需要搜索框? 因为,它早就不只是聊天机器人了。 把OpenAI这一两年的动作连起来看: 文件上传、Projects、Memory,再到能跑几小时长任务的ChatGPT Work、直接生成网站和轻应用的Sites、把C
原推作者是OpenAI未来战略负责人,他说的话完全是出于OpenAI立场和利益来讲的。 他的观点: 1. Kimi 的实力是真的,不像简单蒸馏出来的。 在智能体编程任务里,K...
原推作者是OpenAI未来战略负责人,他说的话完全是出于OpenAI立场和利益来讲的。 他的观点: 1. Kimi 的实力是真的,不像简单蒸馏出来的。 在智能体编程任务里,Kimi已经接近 2026 年第一季度最强的公开模型。不过它很“吃 token”,实际推理成本未必像宣传中那么便宜。 2. 中国继续开放权重,可能不是因为特别支持开放,而是现实选择。 作者猜测,一方面中国政府没有那么相信 AGI 风险;另一方面受算力限制,中国公司难以长期承担大规模云端推理服务,所以更适合把模型权重放出去,让别人自己部署。对企业来说,开源也是追赶者获取用户和影响力的办法。 3. 开源模型看似“加速”,实际上可能抑制 AI 投资。 模型一旦可以免费下载、复制和部署,商业公司就更难靠模型本身赚钱,资本也会更谨慎地投入下一代模型训练。因此作者认为,开源模型本质上反而具有“减速主义”效果。 4. 开源模型的终点,可能是国家补贴的“AI 公共品”。 如果企业无法靠前沿模型持续盈利,最终可能变成政府出钱建设算力中心、训练模型,再以公共基础设施的形式提供 AI。作者把这种未来称为“AI 共产主义”,并对此非常反感。 5. 美国可能不会直接禁用中国开源模型,而是制造合规风险。 比如监管机构发布安全提示,暗示中国模型可能存在后门、数据泄露或供应链风险。即使证据不充分,只要让银行、医疗、金融等受监管企业感到不安,它们就会主动避开。 6. 当前风险可能有限,但未来能力越强,风险会突然跨过临界点。 今天开放一个强模型,世界可能只是“稍微危险一点”;但当模型具备更强的网络攻击、生物设计或自主复制能力时,开放权重的后果就可能非常明显。(原推还影射了新冠疫情) 我的观点: OpenAI显然是慌了,开源模型开始削弱单纯靠“卖模型能力”赚钱的空间。对于OpenAI、Anthropic这种前沿模型公司而言,强大的开源模型必定会降低他们的投资回报;但对于创业公司、科研机构和中小公司而言,开源模型能显著提高创新能力。强大的开源模型,让创新重心从少数模型实验室扩散到更广泛的应用和基础设施生态。 曾经浏览器、Linux、安卓都把底层能力免费化,真正赚钱的部分转移到了云服务、硬件、应用、数据和生态。未来基础模型可能也会变成类似操作系统的东西:底座越来越便宜,利润向上层迁移。 Dean W. Ball: Some observations on Kimi: 1. It's a very good model! I don't think its performance can be explained away by distillation or anything like that. In agentic coding sessions, it seems pretty much on par with the best public models of Q1 2026. In my fairly limited use, it also
BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、...
BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、896 选 16 的 Stable LatentMoE,是全球首个 3 万亿级开源模型。它用 KDA 线性注意力加 Attention Residuals 把上下文撑到 100 万 token,在内核优化、从零写编译器、芯片设计等长程 Agent 任务上接近 Fable-5,但仍落后最强闭源模型,完整权重将于 7 月 27 日前开源。 来源:月之暗面 Kimi [2] ★ 精讲|Agent 跌跌撞撞进入世界|2026 Q2 AI 趋势总结 腾讯企鹅智库的 Q2 复盘把过去三个月串成一条线:通用 Agent 夺走软件入口后,企业烧 Token 的 Tokenmaxxing 运动很快撞上复核瓶颈和成本墙。Multi-Agent、自进化 AI 和 CPU 重回算力中心在补这些缺口,而就业、安全、信息污染和认知缴械开始浮上水面。 来源:腾讯科技 [3] ★ 精讲|Cursor 如何知道 Claude Fable 5 已准备好应对最难的 1% 问题 | Claude by Anthropic Cursor 的模型评测负责人讲他们怎么判断 Fable 5 够格上岗:自建 CursorBench 里它拿到 72.9% 的新高,更关键的是登月模拟里它先入轨采遥测、再落地,体现出超越局部推理的全局规划能力,适合那些连目标在哪都不清楚的难题。 来源:Claude Blog [4] Garry Tan:如何打造 AI 原生公司 [视频] Garry Tan 将 AI 原生公司定义为:把可重复的智能体工作沉淀为持续维护的技能,并以经过治理的公司记忆不断累积竞争优势的组织。 来源:AI Engineer [5] 代理安全差距:54% 的企业已经发生了 AI 代理安全事件,且大多数仍允许代理共享凭据 VentureBeat Pulse Research 的调查发现,超过一半的企业已经经历了 AI 代理安全事件或险情,但大多数仍允许代理共享凭据,并依赖供应商原生控制而非专用的身份和隔离控制。 来源:VentureBeat [6] LangChain Deep Agents:构建长时程 AI 应用的生产级框架 [视频] LangChain 的维护者将 Deep Agents 定义为一套面向生产环境的智能体运行框架:它在普通工具调用循环之上补足规划、委派、外部化上下文、沙箱执行与可观测性,以支撑长时程 AI 任务。 来源:LangChain [7] 世界模型为何可能提升 AI 的样本效率 [视频] 一场 Y Combinator 对谈解释了世界模型如何让 AI 智能体在机器人、游戏和自动驾驶等场景中先预测、模拟与规划,再采取行动,从而以更少数据学习。 来源:Y Combinator [8] 高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践 阿里大淘宝技术团队分享其基于约定驱动与 AI 编排架构,构建自动化评测体系将 Agent Skill 可用性从主观判断转变为可量化工程闭环的实践,重点剖析了评测集生成、双引擎架构、金标设计陷阱及飞轮挑战。 来源:大淘宝技术 [9] 马斯克连夜开源 Grok Build,但 84 万行代码里还留着上传用户整个代码库的痕迹 本文详细报道了马斯克旗下 xAI 开源 Grok Build 编程智能体的前因后果,并深度解析了其 84 万行 Rust 代码库的构成、此前被曝光的整库上传隐私丑闻的技术细节,以及开源后仍残留的上传代码痕迹。 来源:InfoQ 中文 [10] WAIC 今日启幕,我们提前两天完整拆解 Agent 经济落地全路径 本文完整拆解了 Agent 经济从 Copilot 到 Long-running Agent 的落地全路径,覆盖商业模式、基础设施、垂直场景、出海实战等关键议题,并给出组织变革与信任设计的核心框架。 来源:非凡产研 --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
欧盟AI法案OpenRAG:一个SQLite文件中包含933个法律结构化块和BGE-M3嵌入 [P]
I have released EU AI Act OpenRAG, a downloadable corpus of Regulation (EU) 2024/1689 designed for RAG and legal-NLP experimentation. Instead of sliding character windows, the corpus chunks on the Regulation’s legal structure: one chunk per article paragraph one per recital one per Article 3 definition one per annex point chapter, section and provision metadata stored separately The resulting SQLite database contains 933 chunks and a normalized 1024-dimensional BGE-M3 embedding for every chunk. It also includes exact EUR-Lex links, Article 113 application-date metadata and deliberately narrow derived labels. Direct textual classification is stored separately from broader regulatory-regime association, and ambiguous cases remain NULL. I evaluated it against the AI Act Evaluation Benchmark using a like-for-like whole-unit baseline: scenario article recall@20: 0.541 structural vs 0.449 baseline QA article hit@10: 0.927 structural vs 0.898 baseline overall RAG classification remained close and was slightly lower on the structural corpus, suggesting that generator behaviour dominates that task more than chunk granularity I have published the full results, limitations, derivation methodology, label audit and licensing breakdown rather than only the favourable metrics. Dataset: huggingface.co/datasets/faitholopade/aiact-openrag I would appreciate technical feedback, particularly on the retrieval evaluation, structural chunking methodology and what additional baselines would be most useful. submitted by /u/Automatic-Forever-63 [link] [comments]
百度沈抖:每位员工每月发 1000 元额度自由体验主流大模型,强制推行AI办公难见效
7 月 17 日,据虎嗅报道,百度集团执行副总裁、百度智能云事业群总裁沈抖在接受采访时,系统谈到了他对AI落地的判断与百度的内部实践。沈抖预测,通用智能体、行业垂类智能体的规模化落地速度会大幅提升, 2026 年下半年就能明显看到批量落地案例涌现,未来90%的工作都会有智能深度参与、协助完成,但不是完全替代人。 沈抖认为,未来三年是一个关键窗口期。三年内,AI赛道的厂商和独角兽们会不断意识到全栈的优势,而百度智能云的友商也在有意识地补全全栈能力,这对百度智能云来说,既是拥有优势的机会点,也是面对更大竞争的挑战点。 在内部推行AI使用上,沈抖明确表示,强制推行AI办公很难落地见效,百度始终以正向引导、福利牵引为主,不设置硬性使用规定。百度推出了一项常态化的员工福利政策且目前依旧正常执行:为每位在职员工每月发放一千元使用额度,可自由体验市面各类主流大模型产品,不限用途,纯粹是为了降低员工试用门槛,不绑定任何工作考核。他的逻辑是,员工亲身感受到AI工具的提效价值后,自然会养成常态化使用习惯。 财务数据印证了AI业务在百度体系内的分量。IT之家注意到, 2026 年 第一 季度,百度AI收入同比增幅达到49%,收入占比达到52%,这是百度历史上 首次 AI收入占比过半。 关于AI时代的度量标准,沈抖并未展开,但百度创始人李彦宏在今年 5 月的Create2026 百度AI开发者大会上已给出明确方向。李彦宏提出,AI时代的度量衡可能是日活智能体数(Daily Active Agents,简称DAA),与移动互联网最通用的度量衡日活用户数(DAU)相对应。他指出,目前较接近业界共识的度量衡是Token消耗,但Token不一定代表终局,它代表成本、不代表收益,衡量的是投入而非产出;当人类进入智能体时代,衡量一个平台和生态的繁荣,更应该关注DAA这个指标,关注有多少Agents在给人类干活并交付结果,这比无谓的Token消耗更接近价值、也更接近本质。
Soul亮相WAIC2026,发布SoulX多模态交互大模型与AI硬件B Soul
2026世界人工智能大会暨人工智能全球治理 高级 别会议(WAIC2026)期间,上海任意门科技有限公司(Soul)展示了基于实时多模态交互技术的AI生态布局,并发布旗下AI硬件产品B Soul,进一步探索情绪感知与智能交互应用。 Soul CTO陶明表示,自2016年推出Soul App以来,Soul已从社交应用平台发展为聚焦情绪感知、交互技术和AI模型融合的生态型公司。区别于通用大模型路线,Soul以自研交互大模型SoulX为核心,围绕“自有应用+产业生态”构建AI应用体系。 据了解,Soul自2020年前后启动AIGC技术研发,重点布局情绪理解、语音交互和多模态能力,并推出SoulX作为下一代人机交互技术底座。在WAIC现场,Soul展示了基于SoulX打造的实时数字人能力,可实现用户理解、自然语言对话,以及声音、口型、表情和动作同步生成,提升AI交互的实时性和自然度。 此外,Soul还 首次 公开展示AI硬件B Soul。该设备融合SoulX语音交互、情感表达和角色养成能力,将AI陪伴从移动端延伸至物理空间,支持随时唤醒、自然交流和个性化语音互动。 Soul方面表示,B Soul预计将于2026年8月开始逐步量产销售。随着AI从文本交互向语音、视觉、情感等多模态方向发展,情绪感知与实时交互能力正成为下一阶段智能应用竞争的重要领域。
两周搬完一百万行代码:Anthropic用Claude把多年不敢碰的语言迁移压进一个周末
把一门编程语言整套换掉,这种事放在过去,基本等于给公司立一个两年起步的军令状。工程师们谈之色变,预算委员会闻风丧胆,代码库却年复一年卡在原地动弹不得。Anthropic在7月16日甩出一篇文章,直接把这笔旧账翻了篇:过去一个月里,他们内部的开发者用Claude Fable5、Opus4.8和动态工作流,把10个代码包、每个数万到数十万行的规模,干净利落地搬到了新语言上。这不再是将来时态的设想,而是已经发生在他们自己身上的事实。 最刺眼的两个案例像两颗钉子,把想象钉成了现实。Bun的联合创始人Jarred Sumner,用Claude Code把整个Bun从Zig迁移到了Rust,不到两周产出一百万行代码,合并进主干前整条CI测试链100%通过,合并后浮出19个回归,如今已全部修掉,Rust版本6月就已经随Claude Code发布。另一边,Anthropic Labs的联合负责人Mike Krieger,一个周末就把一套Python代码库搬成了16.5万行TypeScript,里面塞了数百个代理、8道阶段闸门、3轮对抗审查,最后还用一套奇偶校验,把每条命令的输出和Python原版逐字比对。 Anthropic把这整套打法提炼成一句话,也是全文最锋利的那把刀:你修的不是代码,而是生产代码的那个流程(循环)本身。一旦想通这一点,那些被无限期搁置的迁移项目,就不再是不可触碰的禁区。 先说清楚什么时候该动、为什么动,因为这件事的前提早就变了。团队启动迁移,通常是因为项目诞生时的技术地形,和今天已经对不上号:要么当初那个心知肚明的权衡终于卡住了脖子,要么出现了更好的路,要么原来的生态正在萎缩。Jarred当初选Zig,图的是C级别的性能加上 极致 的简单,特别适合一个创始人在奥克兰狭小的公寓里、大模型还没出现的年代,用一年时间把Bun写出来。那份简单是有代价的,他后来专门写过文章坦白。 快进到2026年,Bun的命令行工具月下载量已经突破一千万,在Claude Code内部也被大规模使用。就在上季度,这些代价还不足以让人冻结路线图、押上几个季度的资源去做一件大事。迁移语言确实能换来更小、更快、更安全的系统,可没人有动力去付这笔账。工程师们还得掂量其中的职业风险:你可能并行维护两套代码好几年,最后只换来90%的等价,那比一开始就别动还头疼。 现在不一样了。最坏的结果无非是删掉那条分支,重头再来。当然,商业账还是要算的。一百万行级别的迁移,虽然不必再像四年项目那样烧掉三四百万美元的工程师资源,但落地依旧要花数万到数十万美元往上。Bun那次迁移吞掉了59亿个未缓存的输入token和6.9亿个输出token,按API定价约合16.5万美元;Mike主迁移那块也烧了2700万token。真正让Mike下决心动手的,是编译这道坎。他团队的内部工具以单个二进制文件交付用户,用Python工具链为每个平台编译要花大约八分钟,整个构建矩阵一轮下来得等三十分钟。搬完之后,同样的编译只要两秒,二进制启动速度快了6倍,还顺手淘汰了一条独立的部署管线。 为什么AI能把这道旧账算平?因为大规模代码迁移恰好是这些 高级 模型的天选场景。活儿是天然并行的,文件、crate这种成百上千的独立单元,可以让代理同时开干,谁也不用等谁。上下文既清晰又完整,旧代码本身就是给模型 最好 的规格说明书,也是翻译代理照着走的指南蓝本。更妙的是自带裁判,大型代码库里往往躺着一套测试套件,代理能用它来给自己打分,当验证足够客观,模型可以盯着真相死磕好几天,不需要人坐在旁边判质量。队列还会自己写:编译器或测试一挂,下一个要修的活儿就自动排上了。流程本身让偏差无处藏身,审查员每一条发现都要引用背后的规则,于是一次违规变成一个待办项,而不是悄悄分叉;某个代理撞上边缘情况,修法就成了之后所有代理都要遵守的规则。下面两个案例里,Mike和Jarred都在关键步骤用上了Fable,尤其是一种顾问模式,让多个不同档位的模型分工,把token消耗压到 最低。 真正能复用的,是他们总结出的六步法,从这两场迁移里熬出来,又做了泛化,能套到多种语言和场景上。 开工前得先备好一个铁面无私的裁判,否则你既不知道何时收工,也没法衡量成败。这个裁判必须能站在同一标准上同时评判原代码和目标代码。用原语言写的测试套件,往往依赖目标代码里根本不存在的内部函数。要把它造出来,先用Claude把现有测试分个类,哪些是能用外部调用表达的,哪些依赖搬不过去的内部实现;再把面向外部的测试改写成能同时跑在原始代码和移植版上的断言,并派对抗代理去验证改写没有削弱断言力度;最后拿原始代码跑一遍确认它能过,再拿故意改坏的代码跑一遍确认它会挂,一个抓不出破损的裁判,算不上裁判。Mike那次Python转TypeScript,就造了一个覆盖7个真实场景的奇偶校验台,任何行为变动都算要修的bug。 第一 步是立规矩、画依赖图、列缺口清单,给整场迁移打下地基。顺序有讲究:规则手册必须排在缺口清单前面,因为缺口正是由规则手册的默认项覆盖不到的地方定义的,两者还要在联合审计里一起接受检验。规则手册长什么样,取决于你一开始做的核心架构决定:新代码是沿用老结构,还是彻底重做。沿用结构(Jarred那路),手册主要就是一张张把类型和惯用法在两种语言间翻译的查表,遇到难翻的组件再指向缺口清单;彻底重做(Mike那路),手册就是一份设计文档。Jarred是跟Claude聊出来的,给每个含糊地带立一条政策,还专门派了8个子代理,各盯一类他自己凭直觉列出的常见失败模式。依赖图要摸清文件间的依赖,才能把活儿有效地切成并行流,知道哪些先搬、哪些要打包在一起。有些语言和代码库自带清单文件,这事不难,但面对C/C++、Python这类老代码,依赖得自己探出来、画出来,Claude Code能派出代理跑一个确定性脚本把图生成。缺口清单记的是新旧语言之间的硬差距:Zig转Rust,差在手动内存管理,一个忘了释放的缓冲区,编译能过,漏不漏只有运行时才知道;Python转TypeScript,差在接口和契约,Python不要求声明对象长什么样,TypeScript却要白纸黑字写下来才肯编译。Jarred和Mike都把这些隐性知识记进了缺口清单文件,Jarred是前期就盘清楚,Mike是先翻再补,你可能两头都得做。 第二步压一压规则,来一场迷你迁移当试航。Jarred派了一个代理照手册翻三个文件,一个代理像 资深 Rust工程师那样翻三个,再一个代理拿着两份差异去提炼新规则。就在这个阶段,他逮住了两个致命问题,要是等摊到全部1448个文件上再爆,麻烦就大了。这套压力测试只对结构保持型迁移有效,因为同一份文件的两版翻译能逐行比。要是你的手册是重设计,像Mike那样,等价做法是直接拿对抗审查员去炮轰设计文档,再用一次可丢弃的端到端跑通来验证。无论如何,翻出来的文件全部扔掉,这一步的目的只是把规则磨利,不是攒进度。 第三步翻译一切,剩下的步骤都跑同一套多代理循环:实现、审查、修复。实现这种苦力活能甩给小模型,审查留给大块头,Mike铺开12个子代理时用的就是Claude Sonnet。任务队列要机械到无聊:一个批处理脚本看翻译后的文件在不在磁盘上,来决定哪些算完工,再把待办切片丢给实现代理;因为队列每次都从磁盘重建,迁移天生就能断点续跑。代理有时候会过于谨慎、干得太少,解法就是一条干脆利落、带着上下文的指令,提醒它下一步编译器会替它抓错。翻译器没把握的活儿,标上一行// TODO(port): 原因,留给第四步。从这儿往后,待办清单自己会写:编译器数出错,冒烟测试逮住崩溃,测试套件报出失败。两个对抗审查员用各自的上下文给实现者的活儿打分,两者意见相左就交给第三个代理。当一个审查员在多个文件里反复抓到同一种错,修法不是逐文件打补丁,而是在规则手册里加一句话,把受影响的批次重新生成。这一步里手册不断变厚,代码却从不被手工对着它改。还有一个关键设计决定是编译器放在哪:Mike把TypeScript编译器塞进了每一个循环,因为它几秒就能查一个单元;Jarred则把编译器彻底挡在循环外、推迟到下一步,因为cargo要跑好几分钟。 第四、五、六步合在一起说,因为它们共用同一套循环,且越往后越不需要人的判断。第四步编译,取决于语言和规模,它常常融进第三步。Jarred用一个编排脚本在整个工作区调一次编译器,修复代理再并行扫着错误清单干,对抗审查同步进行,构建重跑,如此往复。翻错误清单能帮你抓出系统性的毛病,比如Jarred修完Zig宽松编译所容忍的循环依赖后,冒出几千个Rust模块错误,他给循环加了一段逻辑来分类该删、该挪、还是该重构边界,才算压住。第五步和编译器错误清单一样有机械真相来源:冒烟测试吐出的崩溃,修法依旧是按根因归类、交给对抗子代理审。第六步,也就是故事的尾声,是拿两套代码库的行为逐项比对。文件翻译完、编译完、冒烟完,就把它切碎,把预备阶段那份测试套件套上去跑,失败的交给修复代理对着两套代码审,对抗审查员再查它们的修法。循环再往后是一道构建守护进程,它是 唯一 被允许重建二进制的角色,修复代理只写补丁,守护进程把它们攒批、重建一次、重跑受影响的测试、再把结果喂回来,把最贵的操作串行化,免得一群代理各自触发。当同一个失败在大量测试里反复出现,修法要往上游走:改掉生出这个bug的规则,只重新生成它碰过的文件。Mike这招尤其值得记:很多开发者手头没有现成或移植好的测试套件,他让Claude写了个小脚本,拿7个真实场景同时跑新移植版和Python原版,比输出差异,每个挂掉的场景配一个修复代理,循环跑到7个全过。他还更进一步,让Claude自己设计了端到端测试套件,通宵自主运行,哪里崩就修哪里,连跑四个晚上,逮住了任何场景清单都预测不到的那些细小的伤。 这套打法跑下来,有几条实践在每个项目上都站得住,但Anthropic也提醒,别盲信这份指南,每场迁移都不一样,把它当起点,先跟Claude把你那场的具体方案聊清楚再动手。别盯着单点失败,那是循环的活儿,修复代理会替你把它们磨平,你的注意力该放在规律上。让审查保持对抗、让验证保持机械,对抗审查能撑起更长的任务,多花的那点token往往值;让编译器、差异比对、测试套件这些脚本去当裁判。别什么事都上 最大 模型,token开销集中在你的循环里,要刻意设计,小模型扛得住高吞吐的实现铺开,把 最大 的模型留给审查员,以及任何写规则手册、要被其他代理照着走的人。把人的工时前置,规则手册和压力测试最耗时间,之后基本就是队列在烧。让任务队列机械且可续跑,完工的定义就是输出文件已经躺在磁盘上。 回到结果本身,而不是代码细节。Jarred的Bun迁移已经上线生产,当然任何迁移都有取舍,大约4%的Rust代码待在unsafe块里,主要是C/C++边界上那些单行指针操作。但新代码库是肉眼可见地更好:团队工具能侦测到的内存泄漏全修干净了,一个重复构建2000次的基准测试,内存占用从6745兆字节掉到609兆;二进制在Linux和Windows上小了19%;跨语言优化让它在HTTP服务和next build、tsc这类真实负载上快了2%到5%。 那些你一直忍着没动、将就着用的代码库,也许是时候重新算算这笔账了。挑出那个你容忍最久的家伙,问问Claude,为它做一场迁移到底长什么样。
Suno源代码遭泄露:黑客曝光其大规模抓取音乐数据训练AI模型
生成式AI音乐平台 Suno 遭遇重大安全事件,内部源代码及数据采集信息被泄露,曝光了其用于训练AI音乐模型的大规模数据抓取行为。泄露文件显示,Suno曾通过自动化程序从 YouTube Music、Deezer、Genius 等平台获取大量音乐、歌词及音频素材,用于模型训练。 据报道,此次事件发生于2025年末,一名黑客“ellie.191”通过供应链攻击获取了Suno员工凭证,并进一步窃取公司内部文件。其中,一份包含超过200万个YouTube视频片段的文件夹引发关注。此外,泄露数据还显示,Suno爬虫系统从 Genius 获取超过1.7万小时歌词数据,从 Deezer 获取超过1.2万小时歌曲内容,并从 Pond5获取超过6.2万小时素材音频。相关代码还包含筛选机制,用于排除非音乐文件,以保证训练数据质量。 此次泄露可能进一步加剧Suno面临的版权诉讼压力。美国唱片工业协会(RIAA)此前已代表环球音乐、索尼音乐和华纳音乐等唱片公司起诉Suno,指控其未经授权使用受版权保护的音乐训练AI模型。Suno此前主要依靠“合理使用”原则进行辩护,认为公开网络数据可用于AI训练,但泄露代码中显示的数据抓取流程,可能成为版权方进一步举证的重要依据。 除源代码外,黑客还获取了部分用户数据库信息,包括电子邮件、电话号码以及通过Stripe处理的部分信用卡元数据。Suno方面表示,此次事件属于“有限安全事件”,涉及部分过时代码,且未泄露完整信用卡号码,因此未主动通知用户。 随着AI公司训练数据来源成为行业监管焦点,Suno事件再次凸显生成式AI发展过程中,数据获取合规、版权授权和用户隐私保护之间的复杂挑战。
Google Vids引入Gemini Omni模型 上传自拍+音频就能定制专属数字分身
哪怕OpenAI的Sora可能已经退场,谷歌依旧认定,用户想在AI视频里亲自出镜的那股执念并没有降温。本周四,这家科技巨头给Google Vids甩出一套重磅更新:你只需上传一张自拍和一段语音录音,系统就能捏出一个在外貌和声音上都与你高度吻合的专属数字虚拟人。换句话说,镜头前不用真人到场,一个数字分身就能替你把话讲了。 与数字人同步登场的,是谷歌把自家多模态模型Gemini Omni塞进了Vids平台。这套组合让视频生成变成了一场文字与图片的对话——用户把文字提示词和上传的参考图结合,就能产出自标的视频。Omni还顺手塞进了几项实打用的本领:给手机随手拍的视频换背景、修光线、加 特效 都不在话下。更讨喜的是,它现在支持渐进式编辑,创作途中可以一步一步改,不满意也不用推倒重来,省掉了反复从零开局的折磨。 这一连串升级,正在把Google Vids从一名AI辅助办公演示的工具人,拽向全能型视频创作平台的赛道。把Vids收编进Google Workspace,谷歌释放的信号很直白:它想成为企业做内部通告、培训视频等场景的商业利器。只不过,个性化虚拟人和对话式编辑这两张新牌打出来,也不可避免地让它和HeyGen、Synthesia、Captions、D-ID这些AI视频初创公司,正面撞在了同一条赛道上。 安全与合规这关,谷歌想在了前面。它特别强调,新的AI虚拟人会被严格绑定到账户持有者的真实样貌及其Google账户,并通过SynthID技术打上隐形水印。这道防线意味着,你没法拿它去炮制别人的恶搞或虚假视频,比如给谷歌CEO桑达尔·皮查伊来一张换脸恶作剧。目前,个人虚拟人功能的访问权限只向特定地区、年满18岁的用户开放。当AI分身开始走进办公套件,谷歌试图证明的,是便利与边界可以同框。
2. 8 万亿参数、 100 万词元上下文,Kimi K3 把开源大模型的天花板顶到了全球最高
世界人工智能大会还没开锣,国产大模型就先放出一颗重磅炸弹。2026世界人工智能大会暨人工智能全球治理 高级 别会议即将举行之际,月之暗面于16日正式发布新一代模型Kimi K3,参数规模达到2.8万亿,一举坐上目前全球参数 最大 开源模型的交椅。这不仅是一次数字上的登顶,更意味着开源阵营 第一 次在体量上把闭源巨头甩在了身后。 Kimi K3不是只靠堆参数撑场面。北京月之暗面科技有限公司介绍,这款模型原生支持视觉理解,并具备100万词元的超长上下文窗口,相当于一口气吞下整本专著还能记得开头写了什么。它被针对性地优化用于软件工程、知识工作、深度研究、多模态理解等复杂任务场景,复杂任务的处理能力由此再上一个台阶——从读图识物到长程代码工程,K3试图把过去要拆成多步才能啃下的硬骨头,一把攥进同一个模型里。 资本端已经闻风而动。中信建投在研报中给出了一组颇具信心的判断:全球大模型调用量预计将连续11周环比走高,国产模型凭借高性价比稳稳占据流量前列,海外头部厂商的营收预期也被顺势上调。更值得玩味的是商业化节奏的此消彼长——国内厂商明显提速,DeepSeek准备推出分时定价,豆包已经上线多档会员;另一边,Anthropic收紧了Claude的访问限制,在合规与地缘因素的交织下,国产替代的逻辑被进一步照亮。 沿着这条主线,财联社主题库梳理出几家与之共振的上市公司。三六零在AI领域以360智脑与360安全大模型为核心布局,自研的千亿参数通用大模型360智脑已具备多模态理解、逻辑推理、代码生成等能力。昆仑万维则在7月2日宣布,旗下天工AI在2026年第二季度实现历史性突破,其AI Native模型与产品业务的年度经常性收入(ARR)已跨过8亿美元大关。当2.8万亿参数的开源巨兽落地,国产大模型的景气度,正被推向一个肉眼可见的新高点。
BestBlogs 早报 · 07-17 # Nemotron 3 Embed / Kimi K3 / Inkling / Fable / Bun [1] ★ 精讲|NVIDIA Nemotron 3 Embed 在 RTEB 上排名第一,推动智能体检索发...
BestBlogs 早报 · 07-17 # Nemotron 3 Embed / Kimi K3 / Inkling / Fable / Bun [1] ★ 精讲|NVIDIA Nemotron 3 Embed 在 RTEB 上排名第一,推动智能体检索发展 NVIDIA 开源嵌入模型族 Nemotron 3 Embed,8B 版以 78.5% 登顶 RTEB 检索榜,并配 1B 与 Blackwell 专属 NVFP4 版本(吞吐翻倍、保留 99% 以上精度)。更关键的价值在智能体一侧:更准确的检索让证据更早出现,智能体不必反复搜索、少绕几轮推理,直接压低下游 token 成本,是 RAG 与智能体记忆共同的检索底座。 来源:Hugging Face - Blog [2] ★ 精讲|The Pulse:从 Bun 借助 AI 快速重写为 Rust 我们能学到什么? Bun 作者 Jarred Sumner 用 Anthropic 的 Fable 模型,在 11 天里花费 16.5 万美元,把 53.5 万行 Zig 代码重写为内存安全的 Rust,把原本预计要一年的重构压缩到两周。关键不在于一句提示词,而是 3 小时移植规范、对抗式评审和 64 个并行智能体的工程编排——让过去认为不可能的大规模重写变得现实可行。 来源:The Pragmatic Engineer [3] ★ 精讲|Agent 治理:用 Hook 堵住 LLM 的偷懒、越权与失忆 腾讯数仓 Agent 平台 DECO 总结 LLM 三类顽疾——长脚本偷懒截断、危险操作越权、改表后失忆。核心结论是在 prompt 里写禁止根本管不住,解法是在框架 Hook 切面上做代码级强制:长内容落盘、HITL 门禁、上下文联动补齐盲区,并把基础设施与推理逻辑解耦。 来源:腾讯技术工程 [4] Thinking Machines 发布开源多模态大模型 Inkling Inkling 是一个大型开放多模态模型(约 1T 参数,1M 上下文),原生支持图像、文本和音频输入,具备智能体能力,并在主流推理引擎中提供首发支持。 来源:Hugging Face - Blog [5] Kimi K3,以及我们从鹈鹕基准测试中仍能学到的东西 Simon Willison 评测了月之暗面(Moonshot AI)新发布的 Kimi K3 模型,运行了他标志性的「骑自行车的鹈鹕」测试,并反思了该测试作为快速模型评估工具的实用价值变化。 来源:Simon Willison's Weblog [6] Computer-Use 2.0:从屏幕操控迈向后台智能体 [视频] 这场演讲描绘了计算机使用智能体如何从前台截图循环走向后台执行,并说明可靠评测与沙盒基础设施怎样支撑智能体训练规模化。 来源:AI Engineer [7] Lychee-FD 全双工语音大模型斩获 ACL 2026 杰出论文 哈工大张民教授团队开源了原生端到端全双工语音大模型 Lychee-FD,该研究因揭示了语音与语义建模的冲突并提出层次化解耦架构,荣获 ACL 2026 杰出论文奖。 来源:机器之心 [8] Physical Intelligence 柯丽一鸣 4 小时访谈:Pi 开源模型与机器人的江湖 [播客] Physical Intelligence 研究员柯丽一鸣深度拆解机器人大脑的研发历程、全球机器人学术与产业江湖,并探讨 AI 与人类未来的共生关系。 来源:张小珺 Jùn|商业访谈录 [9] 一文讲透 Skill 本文系统讲解 AI Agent 与 Skill 的关系,从概念本质、运作机制、选择策略到安全实践,配套完整早报 Skill 实战案例,帮助读者掌握定制 AI 助手的核心流程。 来源:腾讯云开发者 [10] 从 Data Lake 到 State Lake:面向 Agent 时代的存储基础设施重构 本文详细阐述了火山引擎存储团队如何围绕 Sandbox Store、Artifact Store 和 Agent 观测与评测三大能力,将存储从 Data Lake 演进为 State Lake,以支撑 AI Agent 的全生命周期。 来源:字节跳动技术团队 --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
征集论文 | RTCA @ NeurIPS 2026 [R]
Call for Papers and Demos Real-Time Conversational Agents (RTCA): Toward Natural Multimodal Interaction 1st RTCA Workshop [@]() NeurIPS 2026, Sydney, Australia 11 or 12 December 2026 Website: We are pleased to share the Call for Papers and Demos for the inaugural RTCA Workshop at NeurIPS 2026, focused on real-time multimodal conversational agents: streaming speech, video, and language generation; naturalness in interaction; and evaluation of live systems. Conversational AI has moved from text chat into the real world, voice modes that talk back, embodied avatars, agents that share our screens and tools. To feel natural, these systems must operate in real time, streaming while continuously listening, watching, and re-planning. This is fundamentally harder than offline generation: latency, turn-taking, backchannels, interruptions, and cross-modal alignment become first-class problems that the offline paradigm sidesteps. Recent progress on full-duplex speech–language models, real-time talking-head generation, and streaming ASR shows the regime is feasible, but the field still lacks shared benchmarks, vocabulary, and methodology for interactional naturalness. RTCA brings together researchers across speech, vision, language, HCI, social-signal processing, and ML systems around three intertwined questions: real-time generation under hard latency budgets, naturalness in interaction, and evaluation of live systems. Topics of Interest We invite original contributions on topics including (but not limited to): Streaming/low-latency speech synthesis, ASR, and full-duplex audio–language models Real-time talking-head, avatar, and embodied video generation; lip-sync, gaze, expressivity under streaming Streaming language models; incremental and speculative decoding for dialogue Turn-taking, backchanneling, interruption handling, and floor management Multimodal alignment under latency and partial-observation constraints Prosody, emotion, and paralinguistic generation in interactive settings Memory, grounding, and tool use during live conversation Evaluation of naturalness: perceptual studies, turn-taking metrics, perceived latency, interactive Turing-style tests Datasets and benchmarks for interactive (not offline) evaluation Efficient inference, on-device deployment, and the systems–quality trade-off Safety, identity, and trust in real-time agents (deepfakes, persuasion, consent) Submission Types We welcome: Full papers (up to 8 pages) — may be presented as posters and/or contributed talks. Short papers (up to 4 pages) — work in progress or focused contributions. Demo papers (Extended Abstracts or up to 2 pages) All submissions must use the NeurIPS 2026 style file and be formatted for double-blind review. Page limits exclude references and appendices. Papers must be submitted in PDF format via OpenReview (portal link to be published on the workshop website). The workshop is non-archival; authors retain the right to publish elsewhere. Important Dates (End of day, Anywhere on Earth) Call for papers opens: 18 July 2026 Submission deadline (papers and demos): 29 August 2026 Author notification: 29 September 2026 Workshop date: 11 or 12 December 2026 Organisers Niki Foteinopoulou — Tavus, United Kingdom Alessandro Conti — Tavus, Italy Jack Saunders — Tavus, United Kingdom Oya Celiktutan — King's College London, United Kingdom Cigdem Beyan — University of Verona, Italy Ioannis Patras — Queen Mary University of London, United Kingdom For more information, visit our website or contact us at [ rtca-workshop@googlegroups.com ](mailto: rtca-workshop@googlegroups.com ). We look forward to your contributions! submitted by /u/Few-Ferret9700 [link] [comments]
LongStraw:固定GPU预算下超越200万Token的长上下文强化学习
A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.
SEED:面向智能体强化学习的自演化在线策略蒸馏
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at
BadWAM:当世界-行动模型梦想正确但行动错误时
World-action models (WAMs) are emerging as a promising foundation for embodied control: rather than predicting actions alone, they learn representations that couple action generation with future world prediction. This coupling is often viewed as a source of robustness, interpretability, and safety, as a robot's action can in principle be checked against its imagined future. In this paper, we show that this assumption is fragile. We introduce BadWAM, a unified framework for modeling and evaluating World-Action Drift Attacks: a new class of WAM-specific adversarial attacks that use small visual perturbations to break the alignment between what a WAM imagines and what it executes. BadWAM characterizes this attack surface along two natural criteria: attack strength and stealthiness. When the adversary prioritizes disruption, BadWAM instantiates an action-only adversarial attack, which directly drives the model toward task-failing actions. When the adversary additionally prioritizes stealth, BadWAM instantiates an imagination-preserving adversarial attack, which seeks to induce harmful action shifts while keeping the model's predicted future close to its clean imagination. Together, these two attacks capture a spectrum of WAM-specific failures: from overt action hijacking to stealthier cases where the model appears to imagine a plausible future but executes a desynchronized action. We evaluate BadWAM across different variants of WAMs. Results show that our attacks substantially reduce task success rates under closed-loop execution. For example, our action-only attack reduces the model performance from 96.5% to 43.1% success. The results of our imagination-preserving attack further exposes a WAM-specific vulnerability: moderate future-preserving regularization can maintain strong attack performance while reducing future imagination drift.
MeanFlowNFT:将前向过程强化学习引入平均速度生成器
MeanFlow generators achieve fast few-step sampling by predicting average velocities over time intervals, making them attractive for efficient generation. Reinforcement learning (RL) has become a powerful way to align diffusion and flow models with human preferences and task-specific objectives. In particular, DiffusionNFT offers an efficient forward-process RL framework that does not require reverse-process trajectories or likelihood estimation. However, applying such RL methods to MeanFlow remains underexplored. DiffusionNFT optimizes instantaneous velocities, whereas MeanFlow samples with average velocities. To bridge this gap, we introduce MeanFlowNFT. Inspired by the MeanFlow identity, which bridges average and instantaneous velocities, we construct an induced instantaneous-velocity predictor. We apply the DiffusionNFT objective to this predictor, making reward optimization well-defined for MeanFlow. Sampling remains based on the average velocity, preserving MeanFlow's fast few-step generation. We further prove that MeanFlowNFT inherits DiffusionNFT's strict policy-improvement guarantee. Experiments on image and video generation show that MeanFlowNFT consistently improves baselines. Moreover, it outperforms prior state-of-the-art RL-tuned few-step generators on most metrics (6 of 8 on SD3.5-M), and can even surpass multi-step RL-tuned diffusion while using only a few sampling steps. For instance, on Wan 2.1, 4-step MeanFlowNFT reaches a VBench score of 84.33, surpassing 50-step LongCat-Video RL (82.57).
RoboTTT:面向机器人策略的上下文缩放
Recent robot foundation models operate with single-step or short-history visuomotor context. We introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency. At this context length, we unlock new robot capabilities: one-shot in-context imitation from human video demonstrations, on-the-fly policy improvement, robustness to perturbations, and stronger performance on multi-stage, long-horizon tasks. We also observe, for the first time, steady gains in closed-loop performance as pretraining context length scales. At its core, RoboTTT integrates Test-Time Training into robot foundation models such as Vision-Language-Action policies, yielding a sequence model whose recurrent state consists of fast weights, parameters updated by gradient descent during both training and inference, compressing histories into weight space and retrieving contextual information for long-context conditioning. To scale training context length, the recipe combines sequence action forcing with truncated backpropagation through time. On challenging real-robot manipulation tasks, RoboTTT improves overall performance by 87% over the single-step context baseline and fully completes a five-minute, ten-stage assembly task, which no baseline ever does. RoboTTT trained with 8K-timestep context outperforms the same model pretrained with 1K timesteps by 62%, suggesting context length as a new scaling axis for robot foundation models. Videos are available at
解密在线策略蒸馏:角色、病理与规范
On-policy distillation (OPD) has become a key paradigm in LLM post-training, yet its training dynamics remain poorly understood. We present a systematic study examining the role, pathologies, and regulations of OPD. We first clarify the role of OPD as an exploration catalyst: it steers the student toward correct reasoning paths via dense token-level guidance, without expanding capability ceiling. We confirm this by showing that prompt diversity matters more than per-problem sampling numbers, and critically, that the effectiveness of OPD hinges entirely on the quality of its guiding signal. This dependency exposes two pathologies that derail exploration. The Student-Teacher Mismatch occurs when a large teacher-student distributional gap causes the guiding signal to misalign with task correctness, steering exploration in counterproductive directions. Length Exploitation arises when the aggregated token-level objective creates length-dependent shortcuts, allowing the student to game the reward landscape through response truncation or redundant padding, exploring degenerate length modes rather than reasoning strategies. To tame these pathologies, we investigate lightweight signal regulations: advantage clipping and log-scale compression, ensuring exploration is guided by faithful signals. Experiments across seven benchmarks demonstrate that these regulations alleviate length exploitation and enable effective distillation, stably surpassing OPD variants and RLVR baselines, thereby confirming that well-regulated signal quality, rather than mere teacher scale, governs successful exploration in OPD.