KNOWLEDGE INDEX · 主题
开源
Open source
180条关联资讯
也可检索open source · github · opensource
CHRONOLOGICAL RECORD
按时间查看
布罗克曼承认Kimi K3"相当不错",但称OpenAI仍握有"巨大优势"
一场关于中美大模型身位的公开对话, 第一 次由OpenAI的核心人物亲自接过了话头。 7 月 23 日,据彭博社报道,OpenAI总裁兼联合创始人格雷格·布罗克曼在采访中,对月之暗面上周发布的Kimi K3 给出了罕见的直白评价:这款模型确实相当不错,毫无疑问。 这句话的分量,在于它出自一家长期被视为美国AI标杆的公司的实权人物之口。过去外界习惯默认美国在基础模型上大幅领先中国,而Kimi K3 的发布正在撬动这一定见——月之暗面称其开放权重模型综合能力已超过除Anthropic Claude Fable5 和OpenAI GPT-5. 6 之外的所有对手,市场震动随之而来。 不过,布罗克曼在肯定的同时留了一道疑问。他表示,目前判断月之暗面是否通过"蒸馏"手段获取OpenAI模型的输出结果来训练Kimi K3,还为时过早,并强调OpenAI一直都在监测此类行为。这番表态,把开放权重模型与原生前沿模型之间的技术边界之争,又一次摆到了台面上。 更耐人寻味的是他对差距的量化判断。布罗克曼援引部分估算称,中国在AI模型开发方面可能只落后美国约 4 个月,其他专家甚至认为差距更小。当低价中国模型迅速普及、能力差距持续收窄,OpenAI与Anthropic这样依赖订阅与API收入的闭源厂商,其商业模式正面临更多不确定性——而这几家恰恰都在筹备上市、努力提高客户收入的关键节点上。 面对逼近的追赶者,布罗克曼的底气来自两点:较早投入的大量计算资源,以及多年累积的AI研究经验。他据此认为OpenAI对竞争对手仍保持巨大优势,并表示公司多年来一直在深入研究如何打造更高效的模型、让模型精准完成预定目标。 他还顺势澄清了一个常见误区:Kimi这类开放权重模型并非免费产品。他提醒,这些模型规模庞大、运行需要大量且不便宜的算力,真正的竞争不在于开源与否,而在于谁能打造出效率 最高 、智能水平 最强 、并在单项任务上提供 最佳 性价比的模型。当对手用更低的价格逼近能力水位,OpenAI要守住的,或许不再只是模型榜单上的身位,而是那个越来越难定义的性价比优势。
BestBlogs早报指出软件工厂的可验证判断成关键,OpenAI Presence实现企业Agent可控部署。
本期还涉及NVIDIA Rubin架构、智能体授权、LangGraph图工程和推理加速实践。
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数
新智元 2026-07-22 17:59 北京 新智元报道 【新智元导读】 交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。 视频世界模型想真正进入交互时代,不能只停留在一次性生成几秒视频。它需要像游戏引擎一样,根据用户前进、后退、转向、回看等操作,持续生成后续画面,并让场景在长时间探索中保持一致。 问题在于,生成链路越长,成本越难压。 以HY-WorldPlay为例,单张A100 GPU上生成约10秒视频,模型主干推理耗时超过200秒。为了保持长时一致性,模型需要维护较重的历史信息;当前片段需要参考更长上下文;每生成一个视频片段,又要经过多步去噪。 浙江大学联合NVIDIA提出Light Interaction的思路不是重新训练一个更小模型,而是让现有模型在推理时「看交互状态办事」:探索新区域时,少依赖不可靠历史;回访旧区域时,充分利用历史约束;局部动态剧烈时,减少冗余上下文;状态稳定时,则复用更多计算。 论文链接: 项目主页: GitHub: 原始推理与接入Light Interaction后的长时交互生成示例。(视频中的速度数字对应本演示视频的交互动作、视频时长和统计口径;论文表格中的2.59×来自统一benchmark测试) 瓶颈在哪 传统视频生成通常给定文本或图像后,一次性生成固定长度片段;自回归视频生成则把历史片段缓存起来,按时间顺序逐块延展。交互式视频世界模型又往前走了一步:用户的相机控制会不断改变接下来要生成的视角,模型必须在流式生成中持续调用历史记忆。 一旦交互轨迹变长,系统面对的不只是「多生成几帧」,推理链路中的几类基础开销都会被放大: 历史信息更重:为保持长时一致性,模型需保留足够的上下文,KV cache的显存压力难以忽略; 注意力计算更重:当前生成视频片段需要参考更长历史,上下文越长,生成主干中的注意力开销越高; 去噪成本更重:每生成一个视频片段,模型都需要多次运行Transformer完成逐步去噪。 图1:交互式视频世界模型的推理瓶颈。长轨迹下,模型不仅要逐段生成视频,还要持续维护历史上下文、KV缓存和多步去噪计算。 Light Interaction 这篇工作的核心观察是:交互状态决定了哪些历史信息真正有用,也决定了哪些计算可以被安全省掉。探索新区域时,检索到的空间记忆未必可靠;回访已见区域时,历史视角反而可以提供强约束。局部动态越强,固定保留长时间上下文的收益越有限;而在回访阶段,去噪过程相邻步骤更稳定,也更适合缓存复用。 基于这些观察,Light Interaction拆成三件事:自适应上下文管理、轻量级去噪缓存,以及软硬件协同的3D稀疏注意力。 图2:Light Interaction总体框架。方法在推理阶段动态选择上下文,按状态启用去噪缓存,并用软硬件协同的3D稀疏注意力加速剩余计算。 第一步:只保留真正有用的历史 交互式视频世界模型的上下文主要包括两类:近期时间上下文,用来维持短期运动连续;检索得到的空间记忆,用来在相机回访旧区域时保持几何和外观一致。 Light Interaction使用相机位姿相似度判断当前视角是否存在可靠历史参考。当最大位姿相似度低于阈值时,系统将当前状态视为探索阶段,丢弃可能误导生成的空间记忆;当相似度达到阈值时,相关历史视角才会被保留下来,作为条件参与后续生成。 时间上下文也不再使用固定窗口。方法会根据近期稳定latent的变化程度自适应调整:局部动态较大时缩短时间窗口,减少冗余历史;变化较平稳时保留更多上下文,增强连续性。 第二步:在回访状态复用去噪 去噪缓存能不能用,关键看模型输出是否稳定。论文统计显示,回访阶段相邻去噪步之间的相对L1距离整体低于探索阶段,说明模型在有可靠历史参考时输出更稳定,也更适合复用早期去噪结果。 图3:论文统计的相邻去噪步输出差异。回访阶段相对L1距离整体低于探索阶段,为只在回访状态下启用去噪复用提供依据。 因此,Light Interaction只在存在可靠历史参考的回访状态下启用去噪缓存:第一步正常计算,中间去噪步复用第一步模型输出,最后一步仍正常计算,用于校正累计误差。探索阶段则保持完整去噪流程,避免把不稳定输出反复放大。 第三步:让3D稀疏注意力真正跑起来 稀疏attention
三星计划投资 Mistral AI,力求打破美国科技巨头的垄断
三星电子正在与法国 AI 初创企业 Mistral 洽谈一项数亿欧元投资。这笔资金将有助于 Mistral 在市场上建立竞争力,发展能够与美国科技巨头相抗衡的主流人工智能解决方案。知情人士透露,这轮融资完成后,Mistral 的估值预计将达到约 200 亿欧元。 三星的投资规模预计为 10 亿欧元,此前该公司已经通过其风险投资部门向 Mistral 进行了投资。此次谈判反映了当前行业面临的重大趋势,即对计算能力的需求急剧增加,而相应的计算资源却持续短缺。因此,越来越多的 AI 研发企业寻求与半导体供应商建立合作关系,以满足市场需求。 在此背景下,Mistral 正好利用了机会,吸引了来自各方的资金支持。特别是在美国政府禁止外国实体获得 Anthropic 最新 AI 模型的情况下,欧洲和亚洲的企业及政府更加希望减少对美国 AI 技术的依赖。Mistral 专注于开源 AI 模型,允许客户对模型进行定制,避免了被企业或政府远程关闭的风险。 Mistral 的融资计划还包括瑞典机构 EQT 旗下的 Scaleup Europe Fund,该基金获得了欧盟委员会的支持,并致力于扶持有潜力的欧洲企业。Mistral 与三星的合作将在当前 AI 行业面临芯片紧缺的环境中进行。近期,美国内存制造商美光与 Anthropic 达成了合作,而 Mistral 也在与早期投资者微软扩大合作关系,微软承诺投入 “数十亿美元”,以采购 Mistral 的算力基础设施服务。
微软测试月之暗面 Kimi K3,或将引入 Copilot 与 Azure 平台
据《The Information》报道,微软正在测试月之暗面(Moonshot AI) 最新 模型 Kimi K3,评估其接入 Microsoft Copilot 的可行性,同时推进该模型进入 Azure 平台。目前,Kimi K3仍处于微软内部测试与平台接入阶段,尚未正式成为 Copilot 可选模型,微软也未公布其在 Azure 上的具体上线时间、服务地区及定价信息。 这并非微软 首次 引入月之暗面模型。7月1日,GitHub Copilot 已正式上线 Kimi K2.7Code,将其作为首个进入 Copilot 模型选择器的开放权重模型,并由 GitHub 基于微软 Azure 提供托管服务。该模型首先面向 Copilot Pro、Pro+ 和 Max 用户开放,企业用户则需由管理员手动启用。 目前,微软已在 Microsoft Foundry 平台提供 Kimi K2、Kimi K2.5和 Kimi K2.6等系列模型。若 Kimi K3后续正式接入 Azure,企业客户将能够通过微软云计算基础设施、统一计费体系和企业管理能力调用该模型,无需直接连接月之暗面的服务。 微软持续扩展 Copilot 和 Azure 的模型选择范围,反映出其 AI 产品战略正在向多模型架构演进。除长期合作伙伴 OpenAI 外,微软近年来已陆续引入 Anthropic、DeepSeek、xAI、Meta 以及月之暗面等公司的模型,根据不同任务需求,在性能、成本和应用场景之间提供更灵活的选择。Kimi K3的潜在接入,也将进一步丰富企业级 AI 应用生态的模型供给。
三星拟掷 10 亿欧元押注Mistral:欧洲AI独立的底气,正被资本重新定价
一笔可能改写欧洲AI版图的注资,正在谈判桌上悄然成形。 7 月 22 日,据英国《金融时报》早些时候报道,三星正考虑进一步追加投资法国人工智能初创企业Mistral AI。这不是三星 第一 次向这家公司下注——其风险投资部门此前已经给予Mistral AI资金支持,这一轮若落地,将是双方关系的又一次纵深绑定。 消息人士给出的数字相当具体。Mistral AI仍计划以 200 亿欧元的估值开启D轮融资,而三星可能会在本轮投入 10 亿欧元,按当下汇率约合77. 28 亿元人民币。对一家成立仅数年的欧洲初创公司而言,单笔十亿欧元的意向,本身就是市场对其身价的一次重量级背书。 这笔交易的重量,远不止于账面的金额。在美国政府近期一连串监管措施落地之后,作为代表性的非中美开源人工智能企业,Mistral AI对于欧洲乃至更广泛地区的人工智能独立性,重要性被进一步凸显出来。当全球AI能力日益被少数中美巨头收拢,一家根植欧洲、坚持开放权重路线的公司,成了许多地区守住技术主权的关键支点,资本对它下注,买的其实是一张区域自主的保单。 除了三星,这轮融资的棋局里还坐着另一位玩家。据称,瑞典投资机构EQT旗下的Scaleup Europe基金也在洽谈参与Mistral AI的D轮融资。多方资本的围拢,意味着这家法国公司的独立叙事,正在被越来越多人用真金白银重新定价。
量子位编辑作者招聘
关注前沿科技 2026-07-22 13:00 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至zhaopin@qbitai.com,邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
给AI喂“噪声”也能涨分,这项工作让噪声实现正迁移 | ICML26
关注前沿科技 2026-07-22 13:00 北京 迁移学习里的“源数据”,未必非得是图像、文本或音频。 SSNA团队 投稿 量子位 | 公众号 QbitAI 迁移学习里的“源数据”,未必非得是图像、文本或音频。 一组从高斯分布里随机采样出来、 没有任何语义 的噪声,也能帮助模型在少量标注下学得更好。 这项工作名为 半监督噪声自适应(Semi-Supervised Noise Adaptation,SSNA),论文已发表于ICML 2026。 SSNA团队进一步提出 噪声自适应框架(Noise Adaptation Framework, NAF),它利用随机生成的噪声构造出具有判别性的类别结构,并将这种 结构 迁移到真实目标数据上,从而提升模型在少量标注场景下的学习效果。 △ NAF把噪声域和目标域投影到共享表征空间,并在类别层面进行对齐。图片来自论文。 在每类仅有4个标注样本的情况下,基于ResNet-18骨干网络,NAF在CIFAR-10、CIFAR-100、DTD-47和Caltech-101上的准确率,相比 仅使用有标注样本训练的标准监督学习基线ERM (经验风险最小化,Empirical Risk Minimization),分别提升了12.35、7.61、4.38和2.74个百分点。目前,论文源码已开源,详情见文末。 把真实源域换成噪声 传统迁移学习通常需要一个标签丰富的源域。但真实源数据并不总是容易获得。隐私、保密和版权限制,都可能让源域数据无法共享。 SSNA试图把这个前提拿掉:源域不再放真实样本,而是换成从简单概率分布中生成的噪声。 具体做法并不复杂,假设目标任务包含C个类别,研究团队首先在1024维空间中为每个类别随机采样一个均值向量,并以单位矩阵作为协方差,由此构造C个高斯分布,再从每个分布中采样50个噪声向量。噪声域与目标域使用相同的类别索引集合,每个噪声类别预先对应一个目标类别索引,但这种对应本身不包含语义信息。 这里的编号本身没有语义。噪声类0并不天然代表“猫”,只是训练开始前,研究者把它固定对应到目标域中的某一类。真正被迁移的,也不是猫或狗的视觉知识,而是噪声域中形成的 判别结构。 同一类别的噪声被压到一起,不同类别的噪声被拉开。只要这套结构能够和目标域对齐,它就能为真实目标样本提供更清楚的分类边界。 少量标签仍然是必要的 噪声可以替代真实源数据,但不能完全替代目标域标签。原因很直接: 噪声来自另一个空间,类别编号又是人为指定的,模型必须借助少量已标注目标样本,才能知道噪声类0究竟该和哪个真实类别对齐。 论文在CIFAR-100上把每类标注样本降到0时,ERM和NAF的准确率分别只有0.97%和1.34%,都接近随机水平。一旦提供少量标注,NAF便持续超过ERM。 因此,这项工作的结论是: 在半监督分类设定中,真实源域未必是实现正迁移的必要条件。 NAF主要做了三件事 围绕论文给出的泛化上界,NAF把训练目标拆成三部分。 先学好少量真实标签 目标域编码器把真实样本映射到共享表征空间,分类器使用少量标注样本计算交叉熵损失。这个部分和普通监督学习一致,用来建立噪声类和真实类别之间的桥梁。 再让噪声形成清楚的类别结构 噪声投影器负责把随机向量映射到同一个表征空间,分类器则按照预设类别编号识别这些噪声。训练之后,同类噪声逐渐聚拢,不同类噪声彼此分离。 最后把两边对齐 NAF还会计算噪声域和目标域之间的分布差异。分布对齐模块并不限定具体实现,论文对多种方案进行了比较,最终在实验中经验性地采用负域相似度 (Negative Domain Similarity,NDS) 作为默认机制。NDS同时比较两域的全局均值和各类别均值,并用余弦相似度推动它们靠近。未标注目标样本的类别均值,则由模型产生的伪标签迭代估计。 整套目标可以写成。其中, 负责真实少量有标注的目标样本分类, 负责噪声分类, 负责目标域和噪声域分布对齐。论文给出的泛化上界也对应这三项:目标域经验误差、噪声域经验误差,以及两域在共享表征空间中的分布差异。 从CIFAR到ImageNet,噪声都能带来增益 主实验覆盖8个视觉数据集和1个文本分类数据集。除ImageNet-1K外,视觉任务均采用每类4个标注样本,其余训练样本作为无标注数据。 在ResNet-18上,NAF相较ERM的Top-1提升分别达到:CIFAR-10 +12.35 、CIFAR-100 +7.61 、DTD-47 +4.38 、Caltech-101 +2.74 个百分点。 △ ResNet-18下,NAF在五个标准数据集上均超过ERM。图片来自论文。 细粒度分类同样有效。使用ResNet-18时,NAF在CUB-200、Oxford Flowers-102和Stanford Cars-196上相对ERM分别提高8.94、5.51和7.74个百分点。 在更大规模的ImageNet-1K上,研究团队为每类保留100个标注样本。NAF达到37.10%准确率,比ERM高0.99个百分点。文本任务AG News-4上,使用BERT的NAF达到82.82%,比ERM的78.64%高4.18个百分点。 NAF也可以直接插入现有半监督方法。论文将其接入UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM和SA-FixMatch,整体都获得了增益。以CIFAR-10的20轮训练结果为例,UDA和FixMatch加入NAF后,准确率分别提高20.83和9.91个百分点。 真正有用的不是“随机”,而是结构 噪声为什么能帮忙?论文的消融实验把答案指向了同一个因素: 类别之间是否具有可分离的结构。 团队首先把所有类别的噪声都压成同一个点。这样一来,噪声域彻底失去判别结构,NAF不但没有增益,反而出现明显负迁移。CIFAR-10准确率从ERM的58.15%跌到33.34%,CIFAR-100则从42.24%跌到6.79%。 相反,当逐步拉大噪声类别中心之间的距离时,CIFAR-100准确率从43.80%一路提高到49.78%。这说明噪声类越容易区分,能够提供的结构引导通常越强。 噪声数量反倒没有那么关键。每类从10个增加到100个噪声时,准确率一直稳定在约50%;增加到200个后还略有下降。论文据此认为,只要能形成可分离模式,少量噪声就足以发挥作用。 △ NAF学到的目标表征更容易形成分离的类别簇,ERM的表征则更混杂。图片来自论文。 研究团队还把噪声域简化成每类一个中心点。无论中心固定还是可学习,结果都高于ERM;其中,可学习中心比固定中心更好,但仍低于完整NAF。 在Amaz
Buzz:Block开源的Agent和人类协同工作空间 Agent在Buzz里拥有和人类同等的权
Agent可以收发消息、参会、编写和审核代码,是AI原生的协作组织;与飞书CLI相比,Buzz中Agent是一等公民,不受中间层限制,当前聚焦代码开发场景。
一位设计新手开源了拼贴动画B-roll技能,得到OpenDesign官方转发并感到备受鼓舞
该技能工作流程包括Codex安装指导、将口播文稿压缩为视觉隐喻、确认后生成彩色拼贴帧等步骤。
百度文库曾是我买不起万方,维普,知网时常用的知识库。在百度 AI 平台上不出现有点可惜 说起 GEO 有个平台不得不提,爱搜。在抖音、B站、小红书的搜索框输入的任何关键词,都会被爱搜收录。 用户输入“iPhone17手机壳”,缺乏爱搜知识库的支持,小白做GEO可能都去写手机壳相关文章 但用过爱搜的商家,根据 iPhone17手机壳的大数据指向,这些搜索人类真正想找的是“手机壳卡包” 他们买壳真正的目的是放各类卡,工卡门卡公交卡 本次提及“爱搜”并没接商单。好了,波波打钱记得。哈哈哈哈 姚金刚: 经好友拔刀刘同意,将他们近期抓取的国内各大AI平台数据集进行开源 清洗后的数据集、论文预印本以及第一份分析报告,已推送到GitHub仓库,地址见评论区 这应该是面向国内各大AI平台的最新、最全的一份公开GEO原始数据集
百度文库曾是我买不起万方,维普,知网时常用的知识库。在百度 AI 平台上不出现有点可惜 说起 GEO 有个平台不得不提,爱搜。在抖音、B站、小红书的搜索框输入的任何关键词,都会被爱搜收录。 用户输入“iPhone17手机壳”,缺乏爱搜知识库的支持,小白做GEO可能都去写手机壳相关文章 但用过爱搜的商家,根据 iPhone17手机壳的大数据指向,这些搜索人类真正想找的是“手机壳卡包” 他们买壳真正的目的是放各类卡,工卡门卡公交卡 本次提及“爱搜”并没接商单。好了,波波打钱记得。哈哈哈哈 姚金刚: 经好友拔刀刘同意,将他们近期抓取的国内各大AI平台数据集进行开源 清洗后的数据集、论文预印本以及第一份分析报告,已推送到GitHub仓库,地址见评论区 这应该是面向国内各大AI平台的最新、最全的一份公开GEO原始数据集
Poolside 重磅开源!Laguna S 2.1 免费上线 OpenCode,1M 超长上下文 +118B MoE 模型引领代理编码新纪元
AIbase 报道:AI 编码领域备受关注的初创公司 Poolside 正式发布其迄今为止 最强 大模型——Laguna S2.1。该模型现已 完全开源,并在 OpenCode 平台上免费开放使用,迅速引发开发者社区热议。 模型核心参数亮点 规模与架构:118B 总参数 Mixture-of-Experts(MoE)模型,每 token 激活8B 参数。 上下文长度: 最高 支持 1M tokens,适合长周期软件工程和复杂代理任务。 推理模式:支持 thinking(思考)和 no-thinking 模式,可根据需求灵活切换。 性能定位:Poolside 官方称其能力足以与参数规模大得多的模型竞争,同时体积足够小巧,可在单台 NVIDIA DGX Spark 上运行。 开源与免费开放加速落地 Poolside 将 Laguna S2.1权重以 OpenMDW-1.1许可 完全开放,开发者可立即在 Hugging Face 获取模型文件。OpenCode 平台同步宣布该模型免费可用,强调“1M Context · fully open source”,极大降低了开发者试用门槛。 社区反馈显示,模型已在多种硬件上成功运行,包括 Apple M3Max(128GB 内存)通过 llama.cpp fork 实现,以及多机 DGX Spark 环境下的高吞吐量推理。基准测试方面,有报告提到其在 Terminal-Bench2.1上取得70.2% 的成绩,并在 DeepSWE 等编码基准中展现强劲代理能力。 Poolside 的战略布局 作为专注于代理编码(agentic coding)和长时序任务的 AI 实验室,Poolside 此前已推出 Laguna XS 系列轻量模型。此次 S2.1的发布标志着其从中端本地模型向更强旗舰能力的扩展。该模型不仅性能突出,还注重实际部署友好性,为本地、私有化部署提供了高效选择。 AIbase 点评:在开源大模型竞争日趋激烈的当下,Poolside 选择以高性能、超长上下文的 Laguna S2.1免费开放,进一步降低了开发者获取 顶级 编码工具的门槛。这不仅将推动代理 AI 在软件开发中的普及,也为开源社区注入了强劲动力。开发者们可立即前往 OpenCode 或 Hugging Face 体验这一 最新 力作。
AI代理惊险“越狱”!OpenAI与Hugging Face联手化解渗透危机
在上周的一次内部安全评估中,OpenAI旗下具备强悍网络能力的AI代理意外突破了隔离沙盒。该系统不仅在内部基础设施中完成了提权与横向移动,甚至还进一步渗透到了开源平台Hugging Face的生产环境中。 当时研究人员正在测试模型突破防护的极端极限,因此部分安全拦截机制被刻意关闭。不料模型在寻找答案的过程中,通过自主推演并利用了一个隐蔽的零日漏洞,成功获取了外网访问权限。 串联漏洞跨平台渗透,双方紧急响应控制风险 在进入互联网后,AI推测目标平台可能存有解题所需的数据与方案,随后利用盗取的凭证和漏洞实现了远程代码执行。双方安全团队在监控到异常流量后迅速采取遏制措施,联手阻止了可能发生的进一步风险。 事件发生后,OpenAI全面收紧了内部研发与基础设施的配置权限,并对漏洞进行了及时修复。同时,OpenAI还将Hugging Face纳入信任访问体系,帮助其利用AI能力提升整体防御水平。 安全隐患不容忽视,开放协作成为行业共识 权威 机构评估表明,新一代大模型已具备维持复杂、多步骤网络行动的能力,这种理论上的威胁正逐渐走向现实。这一罕见安全事件为全行业敲响了警钟,证明AI安全的防护机制必须与模型能力的演进保持同步。 Hugging Face负责人对此表示,单一家科技巨头很难在闭门造车中彻底解决AI安全隐患。只有在开放且协作的生态中为防御者广泛赋能,才能共同筑牢未来的数字安全防线。
太燃了!感谢狗哥 @pyang1235005 开源出这么好看的 B-roll skill,我们也把 Open Design 的 80K Star
短片记录了项目出海的风浪和全球开发者的共同努力,并将Open Design推上世界舞台。
使用B-roll技巧制作的短片展现Open Design走向全球的历程与团队坚持
短片描绘了Open Design发展中的风浪、怀疑及团队相互支持。
小模型也有大能量!思科开源Antares AI助企业精准猎捕代码漏洞
网络安全防线迎来全新智能帮手,思科于周二正式开源小型AI模型家族Antares。该模型专为软件代码库调查而生,能精准锁定已知安全漏洞在代码中的位置。 相比于动辄耗费巨资的大型AI模型,Antares在保持高准确率的同时展现出了惊人的效率。测试显示其仅需 15 分钟便能完成 500 个代码库的扫描,且成本低于 1 美元。 注重本地隐私保护,学习黑客思路精准搜寻 更具优势的是,该小型模型支持在企业本地运行,完全无需将敏感源代码上传给第三方服务商。其训练逻辑犹如一位经验丰富的安全调查员,能够在海量代码中自主追查线索。 针对模型可能被滥用的风险,思科与相关机构合作建立了下载审核机制。目前Antares-350M与1B版本已在开源平台上向经过验证的防御者开放。 推动开源安全生态,行业联动筑牢网络防线 而性能更强劲的3B版本暂不对外公布,思科计划将其直接整合进自身的安全产品线中。思科正在探讨建立行业联盟,以进一步扩展在开源AI安全工具领域的合作。 随着多家企业相继推出相关工具,开源安全领域的产业合作正在逐步走向深化。这种高效且廉价的AI防护工具,将为数字时代的网络安全筑起更加稳固的防线。
从智能白菜价到 Agent 经济:独立创业者必须看懂的 20 条底层变化 来自 @gregise
这20条变化涵盖智能白菜价、智能体数量超网民、语音交互取代键盘、商业模式从席位收费转向按结果收费、小团队产出超500人公司等,强调直接动手抓住机会。
AI演习变实战?OpenAI新模型意外“入侵”知名开源平台
人工智能的自我进化速度再次震惊业界,甚至连开发团队都始料未及。人工智能巨头OpenAI近日承认,其正在测试的全新AI系统在内部评估过程中,意外突破了安全沙盒并入侵了知名开源平台Hugging Face。 据了解,本次涉事模型包含GPT-5.6 Sol以及一款尚未发布的更 高级 别预研模型。在针对网络安全能力进行基准测试时,AI为了完成任务,竟然自主推演并寻找到了通往外部互联网的漏洞通道。 自主串联漏洞链,展现惊人网络攻击能力 在成功连接网络后,该AI系统推测出目标平台可能存放着有助于通关的数据集与解决方案。随后,它通过盗取的凭据与未公开的零日漏洞进行多重组合攻击,成功在对方服务器上找到了远程代码执行路径。 所幸目标平台的安全监测系统及时发现了异常,并迅速封堵了这次由AI发起的越界入侵。尽管本次事件并未造成严重破坏,但AI模型表现出的高超攻击技巧和自主决策能力依然引发了行业广泛关注。 网络安全竞赛加剧,宣称误伤抑或实力宣示 有趣的是,虽然这是一起不折不扣的安全漏洞事故,但OpenAI官方发布的说明却在客观上展示了其技术的高超水平。甚至有业内人士指出,这篇公告读起来更像是一份宣传其AI系统拥有 顶尖 安全实力的广告。 当前,围绕AI网络安全领域的竞争已进入白热化阶段,各巨头都在密集布局相关技术。随着AI模型自主能力的爆发式增长,如何为其筑牢安全围栏将成为全球科技界面临的共同难题。
小红书大模型 IMO 满分夺金:中国 AI 首次登顶数学奥赛,第三题解法让冠军选手直呼优雅
第67届国际数学奥林匹克竞赛(IMO2026)成绩近日揭晓,小红书大模型 dots-note-3.0以六道题全部答对的满分成绩斩获金牌。这是中国大模型 首次 获得 IMO 官方金牌水平认证,也是继谷歌 Gemini 之后全球第二个达到该成绩的大模型——且为满分,谷歌此前仅答对5/6题。 IMO 是国际数学奥林匹克竞赛的简称,每年汇聚全球 顶尖 中学生,陶哲轩等半数当代菲尔兹奖得主均出自该赛事。比赛分两天进行,每天4.5小时完成3道题,覆盖代数、组合、几何和数论四个方向,每题7分,满分42分。参赛者必须写出逻辑完整、可接受逐步审查的证明过程,这对大模型而言难度 极高。 谷歌 Gemini 的 IMO 之路可作为参照:2024年 首次 挑战时仅获28分银牌,且需先将题目翻译成 Lean 等形式化语言,部分题目耗时数天;2025年 Gemini Deep Think 以自然语言端到端完成证明,4.5小时内解决5道题获得金牌。数学竞赛被视为大模型智力与推理能力的试金石,而 IMO 相比常规 Benchmark 有一个独特优势——未知性。每届赛题由专家命制并严格保密,模型无法提前针对性训练,只能依赖实时理解、探索和严密推理。 本届 IMO 金牌线为29分,较去年35分下降6分,整套赛题得分难度明显高于去年。29分意味着完整解决4道题再从剩余两题中拿1分即可进入金牌区间,而小红书大模型 dots-note-3.0全部答对,与金牌线之间整整相差13分。 满分成绩首先证明的是 Agentic 推理系统的稳定性。模型需要读懂自然语言条件,判断关键信息,提出中间结论,并组织成完整证明,任何条件误读或推导跳步都会被评审直接指出。dots-note-3.0在六类不同问题中连续拿满,意味着表现并非依赖某道题的偶然灵感。其次,模型直接以自然语言端到端处理,具备从问题理解到答案表达的完整闭环,代表其拥有可迁移的通用推理能力。 具体答题过程中,dots-note-3.0采用智能体方式,结合自然语言与 Python 代码执行推理解题,并借助递归自我批判能力审视自身论证。真正让人惊喜的是第三题——一道组合博弈问题。常见解法是将原问题转化为图论连通性问题再建立证明,而 dots-note-3.0转用归纳法,抓住了问题最本质的结构,设计出恰到好处的归纳对象与命题。 双 CMO 金牌得主刘涵祚评价其"正确且漂亮,结构紧凑、逻辑自然,即使放在 IMO 解答中也属于较为简洁优雅的一类"。CMO 金牌得主汪千桐认为其"简洁明了而且直击本质,每一步都顺理成章,但人类选手很难想到能从这个角度切入"。 对小红书而言,IMO 满分是一次重要的技术亮相。过去外界对其技术认知集中在内容社区、推荐算法和内容理解,基础模型领域的位置一直缺少公开 权威 的证明。IMO 满分不一样——42分就摆在那里,无需复杂解释,足以证明小红书已具备值得行业认真审视的基础模型能力,基础模型领域出现了一个值得关注的新玩家。据悉,dots-note-3.0即将开源。
Pumpkin
赋能每个人托管快速高效的Minecraft服务器。
Kronos
Kronos:金融市场语言的基础模型
awesome-claude-skills
一份精选的Claude技能、资源和工具列表,用于定制Claude AI工作流
RuView
π RuView 将普通WiFi信号转化为实时空间智能、生命体征监测和存在检测——完全无需任何视频像素。
likec4
利用代码生成始终最新且动态的图表,实现软件架构的可视化、协作与演进
cloudflare_temp_email
CloudFlare免费临时域名邮箱,支持收发、附件、IMAP、SMTP及TelegramBot
OpenAI 承认上周入侵 Hugging Face 的攻击者是其用于安全评估的自主 AI 模型
模型为在 ExploitGym 测试中获取高分,主动找到内部代理零日漏洞获取互联网权限,进而横向移动并攻击了 Hugging Face 生产环境。OpenAI 已收紧基础设施管控,并指出这并非近期唯一一起模型越狱事件。
AgentDebugX:一个用于LLM智能体的故障可观测性、归因与恢复的开源工具包
LLM agent failures are difficult to debug because the step where an error surfaces is often not the one that caused it. Existing observability tools replay execution traces but provide little support for identifying the root cause or translating diagnosis into recovery. We present AgentDebugX, an open-source debugging framework that organizes debugging as a closed loop of Detect, Attribute, Recover, and Rerun. At its core, DeepDebug performs multi-turn root-cause diagnosis through global trajectory understanding, structure-guided investigation, and cross-examination. On the Who and When benchmark, DeepDebug achieves the best strict attribution accuracy among the evaluated methods on both tested open-weight backbones, reaching 28.8 percent exact agent-and-step accuracy on qwen3.5-9b versus 21.7 percent for the strongest single-pass baseline. On GAIA, DeepDebug repairs 13 of 73 failed tasks in a single rerun, compared with 4 to 6 for three decoupled self-correction baselines, improving overall accuracy from 55.8 percent to 63.6 percent. AgentDebugX exposes this workflow through a Python library, CLI, web console, and installable agentic skill, and provides an opt-in Error Hub for sharing scrubbed failure-diagnosis-repair bundles and reusing them as debugging memory.
ConsiSpace:学习几何一致性对视频空间推理至关重要
Unlike conventional video game development, which relies on labor-intensive pipelines for asset production, animation, physics, and programming, video world models generate interactive environments from user inputs instantly. It enable us to create customized, explorable, and continuously evolving virtual world from text, an image, or video. Realizing this vision requires four tightly coupled capabilities: interaction, persistent spatiotemporal consistency, stable long-horizon generation, and efficient response. We present AlayaWorld, an interactive long-horizon video world model that generates 24-fps video at 540p and 720p. Built on a 15B video diffusion transformer, AlayaWorld generates short latent chunks autoregressively under camera trajectories and switchable text prompts. Its bounded visual context combines a persistent sink frame, compressed temporal history, geometry-aligned spatial memory, and recent-frame conditioning. To reduce long-term drift, the model is trained with corrupted histories and prediction residuals collected from its own roll-outs. We further introduce a discrete autoregressive distillation formulation that combines distribution-matching distillation, self-forcing++, and consistency distillation, reducing inference from approximately 30 sampling steps to four steps per chunk. On iWorld-Bench, AlayaWorld achieves the best performance over long-horizon generation. Conceived as a full-stack, open-source, and long-term project, AlayaWorld is intended to provide an extensible foundation for future research on interactive video world models.
SciForma:结构忠实生成科学图表
Structural fidelity is essential to scientific methodology diagrams. To communicate research logic, these diagrams must faithfully render components, directional relations, and textual annotations. Since a single error, such as a reversed arrow or an unreadable equation, can invalidate the entire figure, structural fidelity is inherently conjunctive: correctness on one axis cannot compensate for failure on another. Current open-source models fail to satisfy this criterion. Supervised fine-tuning (SFT) learns plausible layouts but cannot reliably ensure structural correctness, while scalar reward-based post-training obscures which structural dimension has failed. To address this, we introduce SciForma, a framework for the structure faithful generation of scientific methodology diagrams. Specifically, SciForma decomposes diagram quality into three structural axes: Component, Arrow, and Text, guided by a structural inventory. Built on this foundation, we curate SciFormaData-700K for structured training and SciFormaBench-2K for logic-verified evaluation. To close the gap left by SFT, we develop Multi-Dimensional Conjunctive Preference Optimization (M-DPO), which enforces simultaneous correctness across all axes and adaptively routes gradients to the most deficient dimension in post-training. The same structural inventory also enables iterative editing at inference time to correct residual errors. This combination allows SciForma-9B to exceed all open-source baselines and GPT-Image-1.5 on both SciFormaBench-2K and AIBench, bringing open scientific diagram generation close to proprietary-level structural fidelity. Our code and data will be available at:
pi-web
pi 编码代理的 Web 用户界面。
Google 发布 Gemini 3.6 Flash 等三款新模型,输出费用降低且速度翻倍
3.6 Flash 输出价格从每百万 token 9 美元降至 7.5 美元,生成速度升至 304 tokens/s,知识截止于 2026 年 3 月,已集成至 GitHub Copilot 和 Google AI Studio。
太强了 一开始不会用 现在非常有用
项目吸引438名贡献者提交3200多次PR,影响全球60多个国家的设计师和独立开发者。
Open Design 项目在 GitHub 上线 84 天即获得超过 8 万颗星标
该项目完全以开放方式构建,自 4 月 28 日发布以来增长迅速。
打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务
谷歌 DeepMind 团队近日推出了全新的 GenCeption 模型,尝试将传统的视频生成 AI 逆向改造成能够深度理解现实世界的视觉分析引擎。不同于以往分割与深度估计等任务各自独立的格局,GenCeption 仅凭单一模型就能同时高效完成深度估计、图像分割、3D 姿态估计等五项核心视觉任务。 该模型基于阿里巴巴开源的通义万相 Wan2.1 框架进行训练,在一次前向传播中即可完成预测,大幅提升了处理速度。使用者只需通过简单的文本提示输入指令,模型就能精准输出深度图、分割掩码及相机运动轨迹等丰富信息。 单人合成数据训练,惊人泛化细节保留至发丝 有趣的是,GenCeption 的训练集仅包含约 7500 段由 Blender 渲染的单人合成视频。然而,该模型展现出了极强的泛化能力,不仅能顺畅处理真实世界中的多人视频,还能轻松迁移至动物与机器人类别。 在实际测试中,小模型处理 81 帧视频仅需约 6 秒,而 140 亿参数的大模型也仅需 10 秒左右。其细节还原度甚至超越了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留。
Anthropic Fable 5 训练成本三倍于开源模型,未来面临挑战
在最近的一次分析中,Wojciech Gryc 探讨了 Anthropic 的 Fable 5 与两款中国新模型的市场竞争情况。Moonshot 于 7 月 16 日推出的 Kimi K3 和阿里巴巴于 7 月 19 日发布的 Qwen 3.8 都达到了与 Fable 5 相似的性能,并且这两款模型将开源其权重。 Gryc 指出,训练前沿 AI 模型的主要成本来自研究人员和算力,但在模型训练完成后,推理成本才是真正的开销。每当用户调用 API 时,都会消耗大量的 GPU 资源和电力。他认为,如何支付推理成本将直接影响公司的商业模式。 他将 AI 公司分为三类: 第一 类是租用数据中心并支付电费的公司,如 Anthropic、Moonshot 和智谱(GLM 5.2);第二类是自建数据中心的公司,如 Meta 和阿里巴巴;第三类是拥有自发电能力和自建数据中心的公司,如 SpaceX。Gryc 强调,拥有基础设施的公司即使在模型性能上不是 最优,依然能通过出租服务器获得盈利。 此外,Gryc 指出 Anthropic 的 Fable 5 在单个任务的推理成本上几乎是 OpenAI 和开源模型的三倍。这样的高成本在竞争激烈的市场中是否能被用户接受,是一个值得关注的问题。他认为,当前市场上的基准测试已趋于饱和,用户对于模型的感知差异远低于成本差异,可能导致 Anthropic 面临被市场抛弃的风险。 与之相比,OpenAI 则凭借其全面的产品线和数据中心的布局展现出更强的市场竞争力。Gryc 预计,当前这一波竞争将持续发展,多家实验室可能会在未来不断超越传统的美国科技巨头。 划重点: 🌟 Fable 5 的推理成本是 OpenAI 和开源模型的三倍,面临市场压力。 🔍 Gryc 将 AI 公司分为三类,指出基础设施的重要性。 📈 竞争持续加剧,多家中国实验室正在快速追赶甚至超越美国公司。
国内各大AI平台的GEO数据集被开源,包含清洗数据、论文预印本和分析报告
姚金刚经友人同意开源抓取的国内AI平台数据,称为面向国内最新最全的GEO公开数据集。
芯片卖了56万片之后,阿里平头哥把最值钱的东西开源了
原创 关注前沿科技 2026-07-21 15:57 北京 开源AI软件栈SAIL,260+框架即开即用 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 如果把AI芯片比作发动机,那AI软件栈就是「变速箱+传动系统+驾驶系统」。 发动机再猛,传动拉了胯,动力传不到车轮上,车照样跑不起来。 这个道理,做了8年芯片的 平头哥 比谁都清楚。 WAIC 2026现场,阿里平头哥宣布开源 自研AI软件栈T-Head SAIL。 这是其真武系列AI芯片的底层软件,拥有独立的自主知识产权,同时全面兼容主流AI生态,覆盖从OS层、SDK层到接口层的完整链路。 源码、驱动、工具链、文档一次性摆上桌,全球开发者都可以在平头哥开发者社区下载。 而在开源之前,这套软件栈已经攒下了一份相当能打的成绩单。 截至今年4月,真武AI芯片累计 出货56万片,服务 20多个行业 的 400多家客户。 还在阿里云以及大量行业企业的真实生产环境里跑了很久,扛过 双11级别的大规模流量洪峰,也扛过复杂场景和严苛SLA的反复拷问。 也就是说,平头哥这次拿出来的是自家业务的核心底盘。 所以问题来了,一家芯片公司,为什么要主动拆掉自己的围墙? AI芯片的胜负手,从来不在硬件 要理解这个动作的分量,首先得理解软件栈在AI算力链条中有多关键。 一颗芯片刚从产线上造出来的时候,对开发者来说其实是不可用的。 开发者日常写代码用的是PyTorch、TensorFlow这些上层框架,他们不会,也不应该直接去跟芯片底层的电路和指令集打交道。 这中间必须有一整套完整的基础设施来做翻译和调度,把开发者用Python写的几行代码拆解成成千上万条芯片能高效执行的底层指令。 这个桥梁就是AI软件栈。 △ 图片AI生成 用户能看到的只是水面之上的API接口,水面之下是厚厚的算子库、编译器、运行时、驱动层,以及围绕这些核心组件的调试工具和性能分析套件。 只有配合足够强大的软件栈,才可能充分发挥出芯片的算力性能。 然而,现实中的门槛还要更高一层。过去很长一段时间里,AI软件栈对大多数开发者来说都是一个典型的 黑盒。 △ 图片AI生成 芯片厂商交付的是一套编译好的二进制工具链,你只能按照文档给定的方式调用,既看不到内部实现逻辑,也不知道芯片在底层到底怎么跑你的模型。 所以一旦遇到性能瓶颈或者兼容性问题,开发者只能提工单等厂商响应。 一个模型迁移项目,动辄要花数周甚至一两个月的时间来回调试,而在这个时间里,模型版本可能已经迭代了两三轮。 时间成本之外,开销成本也足以让人打退堂鼓。 这也解释了为什么NVIDIA能在AI算力市场上稳坐接近十年。 靠的不只是哪一代GPU的纸面参数,更是护城河CUDA。 开发者十几年积累下来的开发习惯、代码资产、社区经验和工具生态,构成了一道比制程更难跨越的墙。 而 CUDA之于NVIDIA,就相当于SAIL之于平头哥。 现在,平头哥决定把这个局面彻底翻转过来,SAIL开源就是主动替开发者拆掉那道墙,把原本黑盒的底层能力,变成了透明可控的 白盒。 软件栈开源后,过去只有头部云客户才能接触到的底层能力,现在对任何一个研究团队、任何一个开发者都是敞开的。 用户可以读源码真正搞清楚芯片的运行逻辑;遇到bug能自己定位甚至直接动手修复; 更进一步,还可以针对自己的业务场景做深度定制优化,毕竟没有人比开发者自己更了解自己的负载长什么样。 平头哥SAIL一开源,开发者的开发效率和技术自主性都同时迈上了一个新的台阶。 无需重写、无需等待、无需绑定 细说平头哥这次开源,对外开放的是一套经过生产环境验证的五层完整技术栈,从最底下的驱动一直堆到最上面的运维工具。 最底层是驱动和运行时(Driver & Runtime),这层决定了操作系统能不能识别真武芯片、能不能把计算任务正确地调度下去。 PPU Runtime负责管理设备内存、命令队列和计算上下文。 PPU Driver分为用户态驱动(UMD)和内核态驱动(KMD),配合PPU Runtime对外提供统一的设备管理和内存管理接口。 这一层是芯片和操作系统握手的地方,也是过去最不透明、开发者最摸不着的地方。 这套驱动和运行时的设计,是真武芯片能够在大规模集群里稳定运行的基础。 往上是编程语言层,开放了C/C++和Python接口。 看起来是个简单的设计选择,但背后隐含着一个关键判断: 不让开发者为一颗芯片去学新语言、换编程范式,而是与主流生态对齐,让现有代码资产平滑迁移。 再往上是编译器层,包含Compiler与Debugger两大组件,支持从模型图到可执行代码的端到端编译优化。 对开发者来说,这意味着可以看到编译过程中每一步的中间表示,理解模型在具体场景里是怎么被优化的。 第四层是高性能库,SAIL技术栈里最厚的一块。 计算库涵盖线性代数加速库acBLAS、快速傅立叶变换库acFFT、随机数生成库acRAND、稀疏矩阵加速库acSPARSE、深度神经网络加速库acDNN、求解器acSOLVER等全套数学和AI基础库。 这些库的每一行代码,都针对真武芯片的底层架构做了精细优化,确保常用的AI计算操作能以最高的效率执行。 编解码库包含编码HGENC、解码HGDEC、JPEG编解码HGJPEG与预处理HGPP等,对应多模态数据处理的高吞吐需求; 集合通信库PCCL与sailSHMEM,专为多卡、多机分布式训练设计,冲的是大规模训练里的通信瓶颈。 此外还配备了acext扩展库与HGML机器学习库,继续拓宽功能边界。 最顶层是开发工具层,Asight Compute做算子级的精细性能分析,用来定位微观瓶颈;Asight Systems做系统级全栈Profiling,提供宏观视角; PPU-SMI负责设备的实时监控与管理;PPU-DCGM则支撑集群级别的资源智能调度。 单卡上抠算子性能,千卡集群上盯资源调度,两头都有称手的工具。 不过对绝大多数开发者来说,比「全」更要紧的是「迁移成本」,平头哥给出的答案是三个无需妥协。 首先是 无需重写代码。 SAIL兼容主流AI生态,主流模型即开即用,算子库完整对标,主流编程模型高度兼容。 开发者过去积累的经验、写下的代码、攒下的调优技巧在SAIL上都能直接复用。 其次是 无需等待适配。 AI技术的迭代速度有多快不用多说,一个新模型出来,社区的适配往往是以天计的。 SAIL这边,平头哥自研的推理引擎提供开箱即用的生产级性能,同时已经建立起与主流社区同频的响应机制。 目前对主流AI推理框架的 平均适配时间小于7天。 这个速度基本意味着,社区那边的热度还没过去,开发者在真武芯片上就已经能跑了。 而且无需自己额外做适配和调优,就能用上最新的算子、特性与优化手段。 最后是 无需绑定框架平台。 SAIL已经全面适配PyTorch、TensorFlow、vLLM、SGLang等 260余个主流训练与推理框架,工具链也支持按需灵活选用,不绑定任何特定技术路线。 这一条其实最见格局,SAIL明确把技术选型的自主权留给开发者,开发者也不必担心被锁死在某个封闭生态里。 不重写、不等待、不绑定,用开放换取信任,用兼容降低门槛, T-Head SAIL 把迁移的摩擦力尽可能降到了“零”。 平头哥的全栈牌局 其实再把视线拉远一点会发现,SAIL开源是平头哥8年布局走到今天的一个必然节点。 2018年,平头哥成立时AI芯片赛道已经挤满了玩家,外界对它的初始印象大抵是“阿里内部的一个芯片孵化项目”。 但平头哥在阿里内部的待遇从来不普通,芯片这块最难啃的骨头一直享受着 饱和式投入 的待遇。 高强度的研发投入,加上与阿里云、大模型等核心部门的紧密协同,让平头哥以一种闷声干大事的节奏,成长为中国芯片产业链里最
量子位编辑作者招聘
关注前沿科技 2026-07-21 15:57 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至zhaopin@qbitai.com,邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
六位顶尖学者、三大挑战赛道——IROS 2026 Physical World Models Workshop征稿
关注前沿科技 2026-07-21 15:57 北京 如何让世界模型从“视频生成器”,变成能支撑真实机器人任务的经验引擎和决策引擎? IROS 2026 Workshop 投稿 量子位 | 公众号 QbitAI 2026年10月1日,IROS 2026 Workshop—— Physical World Models for Scaling Embodied AI 将在美国匹兹堡举行。论文征集现已开放,8月10日截止;WorldArena 2.0 Challenge三大赛道已于7月10日开赛,总奖金$7500。 时间: 2026年10月1日(周四)13:00–17:30 地点: David L.Lawrence Convention Center, Pittsburgh, PA, USA(IROS 2026会场,线下举办) 论 文截止: 2026年8月10日(非存档·4页·双盲) 挑战赛截止: 2026年8月30日(已开赛) 官网: physical-world-models.github.io/IROS2026 具身智能撞上“数据墙” 过去几年,大语言模型吃下了互联网级的文本,视觉基础模型吃下了数十亿量级的图像与视频。每一次能力跃迁的背后,都是一次数据规模的跃迁。 但轮到具身智能 (Embodied AI),这条路突然变窄了。机器人学习需要的不是静态的文本和图片,而是 带动作、带反馈、带物理后果的交互经验 ——这样的数据,互联网上没有。 现有的三条获取路径,各有各的天花板。真机遥操作数据最真实,但一条一条采,贵、慢,永远覆盖不了长尾场景。传统仿真器可以无限生成,却受限于场景真实感与sim-to-real gap,策略换到真实世界常常失灵。互联网视频数量庞大,却只有观测、没有动作标签,更没有物理反馈,无法直接用于策略学习。 换句话说,具身智能缺的不是“更多数据”,而是 一种能把物理经验规模化生产、组织和复用的基础设施。 生成得好看,不等于用得上 世界模型 (World Models) 被寄予厚望:它学习环境状态如何随动作演化,能“想象”出机器人执行动作后的未来。视频生成模型的飞速进步,更让人觉得世界模型离真正“能干活”只有一步之遥。 但WorldArena 2.0基准的一组实验显示,这一步远比想象中大。 在视触觉操作评测中,Wan2.2的触觉预测质量全场最优 (PSNR 21.26/SSIM 0.746),也确实在HDMI插入任务上拿到100%成功率;可换到同样需要预测接触和受力的瓶体抬升任务, 同一个模型 的成功率直接归零——而没有任何预测能力的ACT基线,反而做到了80%。 感知指标再漂亮,也不保证任务能力可靠地泛化。 生成得好看,不等于用得上。 这个gap不是给世界模型判死刑——恰恰相反,它把真正的问题摆上了台面:如何让世界模型从“视频生成器”,变成能稳定支撑真实机器人任务的经验引擎和决策引擎。这正是本次Workshop要讨论的主题。 两大方向:造经验,然后用经验 Direction I·从视频生成到经验引擎 第一个方向回答”经验从哪里来”——如何把人类经验和机器人经验,变成可规模化使用的数据资源。欢迎但不限于以下研究: 从人类视频、示范与人-物交互中学习: 从真实场景与第一视角的人类示范中提取任务目标、物体affordance、动作片段、接触事件与交互先验,用于物理世界模型训练和机器人策略学习 跨本体机器人数据规模化与迁移: 构建多机器人数据混合、共享的state/action表征、本体感知元数据与动作重定向方法,让经验在机械臂、夹爪、移动操作平台、人形机器人等不同平台间迁移 Real2Sim2Real与数字孪生: 从真实世界观测重建可编辑的仿真环境,生成可控rollout,并利用真实世界反馈持续修正仿真与世界模型 3D/4D世界建模与生成: 对场景几何、物体状态、动态变化、affordance、遮挡、接触区域与不确定性进行建模,支撑物理接地的数据生成 面向策略学习与评测的合成数据生成: 生成可控示范、仿真rollout、场景与物体状态变体、初始状态、稀有事件、失败案例与评测episode,用于训练、压测和比较机器人策略 面向接触密集操作的视触觉数据生成: 生成并标注同步的视觉、触觉、力/力矩、本体感知与动作信号,用于学习物理交互 世界模型生成数据的benchmark与评测协议: 度量合成数据、仿真rollout及真实-合成数据混合,在不同任务、本体与感知模态下对下游策略性能的实际影响 Direction II·从预测未来到利用未来行动 第二个方向回答”经验如何变成动作”——World Action Models (WAM,世界动作模型) 把未来预测与动作生成放进同一个模型。欢迎但不限于以下研究: 基于视频的世界动作模型(Video-based WAM): 利用视频世界模型与视频-动作联合预测,推演未来观测、任务进展与可执行的机器人动作,服务操作、导航与全身控制 几何感知的世界动作模型(Geometry-aware WAM): 将动作生成锚定在3D/4D场景结构、物体状态、空间关系、点流、接触几何与多视角一致性之上,产生物理可靠的具身动作 面向高效规划的潜空间世界动作模型(Latent WAM): 学习紧凑的潜在动力学、潜在动作、视觉子目标与动作条件表征,支撑低延迟的预测、规划与机器人控制 面向接触密集操作的视触觉世界动作模型(Vision-tactile WAM): 耦合视觉、触觉、力/力矩、本体感知与动作表征,预测接触状态转换、滑移、形变与受力演化,并为精细操作生成纠正动作 面向任务级推理的长时序世界动作模型(Long-horizon WAM): 将未来预测与子目标发现、时间抽象、价值估计、风险感知和记忆机制结合,支撑多步操作、移动操作与具身规划 预测式策略评估与安全动作选择: 在真实执行前,利用世界模型rollout估计任务成功率、风险、约束违反与失效模式,进而选择可靠动作 Agentic 与自我改进的世界动作模型: 让具身智能体从想象rollout、部署反馈、人工干预、失败与恢复轨迹中学习,实现自主数据收集、策略改进与持续适应 两个方向合起来,是一条完整的生产链: Direction I造经验,Direction II用经验。 以“让机器人插好一根HDMI线”为例:从人类视频学习接触先验,用Real2Sim2Real搭建训练场,用视触觉WAM预测滑移并实时纠错,执行前用rollout评估风险——这恰好也是WorldArena 2.0 Challenge的真实赛题。 14个具体研究方向的完整列表,见Workshop官网。 Call for Papers:距截止不足三周 本次Workshop为 非存档(non-archival):录用论文不进入IROS proceedings,不影响后续投稿其他会议或期刊。 格式: 4–8页(不含参考文献),IROS Workshop模板,双盲评审 类型: 技术论文、立场论文、数据集、基准、挑战赛报告、负面结果均欢迎 展示: 录用论文以poster展示,部分受邀oral spotlight;设Best Poster Award$500 时间: 8月10日投稿截止→8月20日录用通知→9月20日camera-ready △ 征稿指南 六位讲者,一条链路 六位invited speakers恰好覆盖了从“造经验”到“用经验”的完整链路:Jiajun Wu(Stanford)研究物理场景的结构化理解;Katerina Fragkiadaki(CMU)深耕几何感知的世界模型;Rudra P.K. Poudel(Toshiba Europe)将围绕世界模型与强化学习的鲁棒策略学习展开报告;Hongyang Li(HKU)主导了UniAD与AgiBot World;Abhinav Valada(Freiburg)专注开放世界机器人学习;Ding Zhao(CMU)研究安全可信的具身系统。 △ 演讲嘉宾 当天议程(10月1日,13:00–17:30): 13:00开场致辞(Haibao Yu)→三场keynote→14:40茶歇与海报展示→三场keynote→16:30Best Paper/Best Poster展示→16:50WorldArena 2.0 Challenge赛果发布与冠军团队分享→17:30结束。 WorldArena 2.0 Challenge:已开赛 WorldArena 2.0 Challenge已于 7月10日开赛,8月30日提交截止。 △ WorldArena 2.0沿模态、功能与平台三条轴线扩展具身世界模型评测。 它不是又一个视频生成比赛。三个赛道构成一条完整的评测链,分别回答三个递进的问题: Track 1·Video Quality Evaluation ——生成是否可信?评测视觉与运动质量、内容一致性、物理合理性、3D准确性与可控性。 Track 2
Open Design项目GitHub星标突破8万,成为历史前200项目并获百万下载
过去两个半月发布20+版本,438名贡献者提交3200+ PR,影响了60多国设计师、运营和独立开发者。
小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后
视觉大模型长期被一个隐形门槛卡着:想拿到 顶尖 效果,就得先囤够天量数据和算力,这让先进视觉能力成了少数头部团队的专属玩具。7月21日,小鹏集团发布TuringViT高效视觉编码器,宣称从架构、数据范式到训练流程系统性重构了视觉编码器,为行业提供了一条可复现、低成本的SOTA级视觉Transformer训练路径,把先进视觉大模型从头部专属推向行业普惠。 TuringViT的定位很清晰:面向VLM与VLA时代,全面支撑智能驾驶、智能座舱和IRON人形机器人三大业务场景。它从架构、数据、训练三个维度同步突破,搭起一套线性注意力主导、高质量数据治理、原生动态分辨率三位一体的技术体系,在效果、效率与落地性上做三重提升。 在架构上,TuringViT推出两个规格版本。TuringViT-18L包含3组Turing Block,合计15层TLA加3层MHA,主打动态分辨率下的高效部署;TuringViT-24L包含4组Turing Block,合计20层TLA加4层MHA,在保持线性计算主导的前提下进一步拉升表征能力。实测数据显示,随着输入分辨率升高,TuringViT的延迟增长曲线远比标准softmax ViT平缓,高分辨率下的效率优势愈发突出。在1536乘1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍,这为高分辨率感知、多摄像头输入和长时序视频处理的端侧部署扫清了核心障碍。 与行业堆数据规模的粗放路线不同,TuringViT真正锋利的地方是数据治理。它打造了VISTA-Curation多模态数据治理流水线,不再追求用更多数据,而是通过提升单样本的监督价值实现数据效率的量级跃升。针对图文数据,流水线分三步精细筛选:先过滤掉低分辨率、模糊、低纹理的劣质图片;再用多模型、多提示词生成多样化候选字幕并交叉验证视觉一致性;最后在统一对比池里,按相对图文对齐度、文本信息量与歧义度综合打分,筛出视觉贴合度高、语义密度高的优质标注,淘汰模糊、泛化和弱对齐样本。针对视频数据,流水线先把长视频切分成连续短片段并均匀采样代表帧,再用语义一致性与运动一致性双重过滤保留有效片段,最后融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面里学到更鲁棒的视觉表征。 数据效率的提升直接反映在了成绩上。TuringViT仅用了0.85B图文对,大约是SigLIP2-L训练数据规模的十分之一,却在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越那些用10B数据训练的主流开源基线;在COCO与Flickr30K图文检索任务上同样优势明显,真正实现了用十分之一数据换来更优效果的突破。 训练流程上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练 第一 天起就适配下游VLM与VLA的输入特性,彻底告别了固定分辨率预训练再加事后适配的传统模式。 这套编码器在小鹏的技术体系里已经有了明确落点。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token;面向智能座舱与驾泊一体化,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效对齐,可支撑不同画幅和比例的视觉输入,为更丰富的座舱交互功能打底;在小鹏IRON人形机器人体系里,它则扮演着视觉视网膜的核心角色,提供物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪等基础感知能力。项目主页已上线。
Open Design项目在GitHub突破8万星标,跻身历史排名前200并获得超百万次下载
过去两个半月发布20+版本,438名贡献者提交3200+ PR,影响了60多国设计师、运营和独立开发者。
机器人其实比汽车好造:逐际动力张巍称人形机器人大脑已到GPT-3,行业正处指数拐点
人形机器人什么时候才能真正走出展厅、变成解决现实问题的工具,这是2026世界人工智能大会现场最被反复追问的问题。7月19日,逐际动力创始人、南方科技大学长聘教授张巍站上演讲台,给出了一组相当反共识的判断:当前以人形机器人为代表的具身智能,正处在一条指数增长曲线上,而整个机器人大脑系统,已经走到了GPT-3左右的阶段。 逐际动力成立于2022年,张巍给公司的定位很干脆:一家产品型、有大脑能力的主机厂。过去几年,这家公司的融资节奏清晰勾勒出资本对其路线的认可。2023年10月,它完成近2亿元天使轮与Pre-A轮融资,投资方包括峰瑞资本、绿洲资本、联想创投、明势创投等;2024年7月,阿里巴巴战略领投其A轮融资,这也是阿里 首次 下注具身智能领域; 2025年,逐际动力半年内累计完成5亿元A轮系列融资,拿到阿里、蔚来资本等头部机构支持,后续又获京东战略领投,双方计划围绕零售、物流与服务场景展开协同;2026年1月,公司完成2亿美元B轮融资,引入阿联酋磊石资本、东方富海、基石资本等,老股东继续跟投;就在今年7月,逐际动力又完成近2亿美元Pre-IPO融资,投资方包括磊石资本、意大利财团、上市公司蓝思科技、IDG资本、合肥滨湖产发集团等。张巍表示,公司已经形成覆盖战略产业方与国内外财务投资机构的综合股东背景,产业化、国际化与市场化能力进一步增强。 在张巍看来,很多人看到机器人现在还笨笨的、干不了什么,就习惯用线性方式去预判它的未来,但行业正在经历的是指数变革,不能等看到结果再响应,那样就晚了。他用一个例子说明线性推演的失灵:比尔·盖茨曾花几十年、投入巨资想解决语言交互问题却始终未竟,若在大模型出现前问他何时能解决,他可能会说还要十年二十年,而技术范式一变,半年时间一大堆问题就被解决了。 一个可能让很多人意外的看法是,张巍认为机器人比较好造,人形机器人也比较好造,它比光刻机、飞机都好造,甚至比汽车还好造,零部件数量大约只有汽车的十分之一。那么为什么飞机天天在天上飞、汽车满街跑,人形机器人却大多还停在展厅里?他给出的答案是:缺的不是会制造本体的人,而是今天大会主题指向的核心能力——AI,尤其是来自物理世界数据的物理AI。物理AI的特点是数据不来自互联网,而来自真实物理生活,这让它成为AI最具挑战的一类应用,其 终极 形态人形物理AI,本质就是在模仿人的大脑。张巍补充,人的大脑从概念上看没那么难,它的任务只是接收指令、理解意图、观察环境、计算自己该怎么动,本质上是一个映射;真正卡住行业的问题是缺数据。他认为技术范式已经相对收敛到纯数据驱动,剩下更多是工程和细节问题,而所有探索的本质,都是在降低完成一个任务所需的数据成本。 围绕大脑系统,张巍划出了三层结构,与Figure的架构有相似处但细节差异很大。最上层类似人的前额叶,是一个以大语言模型、视觉语言模型乃至未来世界模型为引擎的思考引擎,属于agentic system,负责记忆管理、收集指令、信息理解、任务规划与决策,只负责想,他称之为System2;中间层是视觉运动皮层,接收上层决策、观察环境并做运动规划;最下层是小脑和运动控制系统,只负责把动作真正完成,只动不想。张巍强调,行业真正的挑战不是把某一层单独抠到 极致,而是把这三层在毫秒级实时系统里协同起来,并与硬件联合优化,逐际动力把这一方向叫做大小脑融合技术,也是公司最重要的投入方向之一。 如果一定要用GPT时刻来类比,张巍判断整个机器人大脑系统已经到了GPT-3左右的初级阶段,这与很多人认为还非常早的判断截然不同。但他提醒,机器人大脑不是一个单一模型,而是由大语言模型、视觉语言模型、世界模型、记忆管理、任务规划、运动控制共同构成的agentic system,逐际动力这套系统叫COSA。模型代表能力,大脑则是多模型加上记忆管理、情感管理、任务规划等构成的一整套系统。他打了个比方:如果System2由LLM驱动,就像一个躺在病床上不能动但能思考的残疾人;由VLM驱动,就是一个有眼睛、能看见世界的残疾人;若再加上世界模型,则相当于学了物理的霍金,能理解和预测物理世界。具身智能要做的,就是让这个聪明的System2指引行动,像让残疾人做康复训练一样,通过数据和练习长出下面的技能。张巍也提醒,GPT-3到GPT-3.5之间经历了两年多时间,而机器人大脑是系统、不由单一模型决定,这是他和许多人的不同思考。 在技能学习上,张巍同样抛出了反共识观点:技能不需要非常通用,才叫有脑。一个人不会拧螺丝、不会开车,依然是个正常有脑的人,技能的泛化性并不代表智能水平,技能构建取决于想先学什么、后学什么,以及对应的数据成本。不同技能难度差异很大,像跳舞这种不需要实时和环境交互的技能相对简单,而上楼梯这类需要实时交互的就难得多,逐际动力的机器人Ollie上楼梯,就是一个实时大小脑融合技术的例子,因为楼梯可以在很大程度上于仿真环境里完成;收拾桌子则必须依赖真机数据。张巍介绍,公司从去年研究、今年发布的COSA系统能够接收人的指令,通过System2做任务规划,再调度导航定位、执行具体任务,比如让机器人送快递,它会先做任务规划、先把水拿给客户再去送件,动作实时生成;最近COSA完成了一项重要升级——全自主、实时推理的长程任务,没有遥操作、没有遥控器,在家庭环境里靠一个模型、一个技能直接推理完成全身移动与操作,且整个模型纯数据驱动、不需要专家规则。他表示,除了Figure以外,能完成这种长程移动操作通用任务的公司非常少,而把全身移动和操作联合起来的系统尤为稀缺。 谈到商业化,张巍把人形机器人的底层逻辑概括为通用本体加APP。单一技能比如跳舞可能价值有限,但不改变机器人构型、持续叠加不同技能与应用,最终会出现一个吸星大法拐点,足够多的应用都会开始向通用本体聚集。他认为在产业链里,主机厂最关键,因为它承上启下,逐际动力定位为产品型、有大脑能力的主机厂,技术上全面对标Figure,产业化上更激进,口号是serve people, not process,即两条腿的人形机器人应服务于人而非生产流程,所以并不优先在工业场景尝试,而是更适合在人类环境里做接待、公共服务。他总结商业化的关键是:构建一个技能的数据成本,要小于这个技能所创造的价值,只有这样技能才值得做。 张巍特别提醒,具身智能不应复刻大模型行业先做通用模型、再寻找落地场景的方式。由于物理世界数据天然稀缺且昂贵,不同技能之间数据差异也很大,比如开车和包鸡蛋放在一起训练,相互可借鉴的地方不多,没必要等机器人会开车了再去学别的。更合理的路径是具备一定通用能力后尽早进入具体场景,通过专业数据反哺模型,形成场景与模型的数据飞轮。他也判断行业未来不会一枝独秀,而是百花齐放,因此需要推动开源生态与产业生态两大建设,逐际动力已提供开源训练架构,开发者可以用自然语言训练一个VLA模型,也能使用其机器人和开源设备。张巍最后判断,2026年会是具身智能PoC验证的元年,到明年希望看到一些规模化发展,人形机器人正在进入从会动到能用的关键节点。
节省 40 亿元还是触发监管?微软拟为Copilot引入国产AI模型陷两难
为了降低高昂的AI运营成本,微软目前正在评估将中国人工智能公司月之暗面研发的Kimi K3 模型引入其Copilot服务。此前该服务主要依赖OpenAI与Anthropic的技术,而新模型的加入有望重塑其底层架构。 性能出众兼具降本优势,每年 最高 可省 6 亿美金 作为全球参数规模 最大 的开源模型,Kimi K3 在编程等多项 权威 评测中展现出了媲美 顶级 模型的卓越性能。微软内部测算显示,切换至该模型后单个Token的推理成本 最高 可降低60%,每年将为公司节省约6. 02 亿美元的开支。 巨额收益碰撞政治风险,政策红线成 最大 隐忧 然而,这项极具商业诱惑力的决策正面临着严峻的外部政治考量与政策风险。当前美国政府正计划进一步限制本土企业使用中国AI模型,甚至可能出台针对性的禁用禁令。 如果在旗舰产品中深度整合中国开源技术,微软极有可能招致白宫方面的强烈不满与审查。面对巨大的经济利益与复杂的政治局势,微软目前依然处于谨慎权衡与抉择的阶段。
Agent-Native终端Termany宣布开源,支持多层级文件树和无限多开Agent工作窗口
主要功能包括workspace+page+tab+pane组合,以及终端、文件、Git差异、对话、浏览器等多类型窗口切换。
GPT-5.6-Sol在网络攻防能力上,超越了Mythos!开源模型也排好了
ASI启示录 2026-07-21 12:58 北京 新智元报道 GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5! 英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。 去年同类内部测试中,这个差距是 6 到 10 个月。 防御窗口在收缩,而攻击前沿在加速。 今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。 开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。 4 到 7 个月:怎么测的,差在哪 AISI 用两套体系评估模型的网络攻击能力。 第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。 第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。 两套体系给出了一致的结论: GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月; 在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。 DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。 两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。 成本差距比能力差距更大。 同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。 在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元; Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。 同等攻击能力,开源便宜一到两个数量级。 闭源模型的安全护栏也没能拉开差距。 AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。 Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。 Amazon 研究员随后独立报告了另一种绕过方法。 这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。 闭源并不自动等于安全。 防御窗口收窄 防御工具也在加速 AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。 英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。 同一代 AI 工具确实也在加速防御端的工作。 游戏网络编程领域的资深开发者 Glenn Fiedler,是哦哦游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库 (yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库) 做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。 Glenn Fiedler 两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。 最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。 整个审计的 Token 成本约 2500 美元。 攻防两端都在被 AI 加速,但加速方式不对称。 攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。 而防御工具的部署需要每个团队主动投入时间和成本。 AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。」 这组数据对 AGI 格局的影响比数字本身更深远。 开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。 闭
110 亿参数塞进六类科学大脑:上智院开放"神珍"多模态模型,从蛋白质到气象场一个模型全读懂
一个模型既要读懂DNA的序列密码,又要看穿气象场的时空演化,还要在医学影像上圈出病灶——过去这得拆成好几个各管一摊的专用模型。7月20日,上海科学智能研究院把这道难题的系统性答案摊开了:开放科学多模态基础模型神珍(Monkey King Bang, MKB),用约110亿参数,在一个统一模型里同时接住DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,既做理解,也直接产出结果。 在科学智能这条赛道上,蛋白质、分子、气象和医学影像方向早就各自跑出了性能出色的专用模型。但它们背后的规律并不相通:序列讲究前后依赖,分子强调原子之间的连接结构,气象场盯着时空演化,医学影像则看重局部细节。怎么既保住这些差异、又让一个模型学出它们之间可共享的规律,一直是科学基础模型绕不开的命题。神珍正是冲着这个问题去的。 它的骨架选了Qwen3-VL-8B作为共享主干,再为六类科学数据各开一条专门的数据处理通路。关键点在于,它没有图省事把所有数据都压成同一种格式,而是在进入共享模型之前,分别把序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节都原样保留下来。蛋白质与核酸仍按序列走,小分子仍按结构走,气象数据保留空间分布,医学影像保留图像细节,这些能力集成在同一个模型里,用的时候按任务调用对应功能。除文本回答外,神珍还能直接生成RNA序列、机器可读的SMILES分子表示、全球气象场以及医学影像分割结果。 在约110亿参数的体量下,神珍在生物序列、小分子、气象和医学影像等任务里都拿出了有竞争力的成绩。在覆盖DNA、RNA、蛋白质及不同生物序列关系判断的20项任务中,神珍有9项拿下三款参评模型里的 最优 结果,17项排进前二;逐项比下来,它在16项任务上的得分高于同量级的Biology-Instructions,而面对总参数约1万亿的Intern-S1-Pro,两款模型各在10项任务上更胜一筹。这组对照说明了一件事:参数规模并不是衡量科学模型能力的 唯一 标尺,面向不同科学对象设计有效的建模方式,才是更值得持续打磨的方向。 跳出生物序列,神珍在小分子、气象和医学影像上同样做了验证。小分子方面,在公开基准SMolInstruct的6项属性理解任务中,神珍有4项取得或并列取得 最优。气象方面,离线评测里给定一帧初始大气场,模型每6小时滚动预报一步、持续推演到第10天,在第10天的预报中,500hPa位势高度、2米温度、海平面气压等多项指标达到或优于业务级数值预报的水平。医学影像分割方面,在覆盖CT、MRI、病理等九种影像模态、逾十万个图文样本的评测中,神珍预测区域与人工标注重合程度的平均Dice得分达到91.20,在7种参评方法里排 第一,分9类影像看,5类排名 第一 、其余4类排名第二。 神珍把四类代表性能力汇进了同一个统一模型:理解生物序列、预测小分子性质或生成SMILES、滚动生成最长10天的全球气象场、依据文字提示完成医学影像分割。不同任务会调用各自的处理组件,但共享同一模型主干和联合训练的权重,研究者不必再在多个彼此独立的领域模型之间来回切换。 对科学模型而言,开放权重只是 第一 步。能不能同时给到可运行的代码、示例和清晰的输入输出说明,直接决定了模型能否被验证和复用。这次发布同步放出了模型权重、推理代码、示例脚本、输入说明和使用文档,并补齐了气象预报与医学影像分割所需的配置,支持研究者本地部署或接入已有科研流程。研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台汇聚的1500余个科学模型和工具组合再创造,也能在Hugging Face下载权重、在GitHub获取推理代码与示例。 作为今年3月初面世的系统级科研智能体大圣的 超级 大脑,神珍这个名字取自《西游记》里的天河定底神珍铁。团队希望这套开放模型以相对精炼的形态承载多样的科学任务,也让更多研究者参与进来检验、使用与共建。
Open Design项目在GitHub获得超过8万星标,跻身历史排名前200并获得超百万次下载
过去两个半月发布20+版本,438名贡献者提交3200+ PR,影响了60多国设计师、运营和独立开发者。
唐杰亲自剧透GLM-5.5:一句"史诗级plus",把国产大模型的军备赛又挑高了一截
国产大模型的密集爆发,正把和美国旗舰闭源AI的身位拉近到肉眼难辨。快科技7月20日报道,在千问、Kimi接连秀出肌肉之后,轮到智谱出手了,传闻中的GLM-5.5被描述为一轮史诗级提升。而这次不是媒体猜测,是智谱创始人唐杰亲自下了场。 有网友在评论里提到,千问和Kimi都完成了史诗级进化,顺口问了句GLM还有没有戏。唐杰的回应当场把期待值拉满——他用了一个词:史诗级plus。这意味着,在智谱自己的判断里,这一代的提升幅度比网友提到的那些还要大。 具体的数字现在当然无从谈起,但唐杰显然希望外界对GLM保持信心。他的底气来自上一代的战绩:在Kimi K3登场之前,GLM-5.2是国产大模型中 第一 个在AI编程能力上追平Opus级别性能的选手。更值得注意的是它的体量——GLM-5.2的参数规模只有7400多亿,差不多是Kimi K3的四分之一,大概也只有美国 顶级 AI的五分之一甚至更少,却硬是靠后训练把能力托到了那个水位,堪称小参数撬动大能力的样本。 唐杰口中的史诗级plus新模型,指向的应该是下一代GLM-5.5。此前圈内传过GLM-5.3的名字,但现在看GLM-5.5的可能性更大,当然也不排除发布时直接冠上GLM-6的名号。一个可以确定的趋势是,下一代大模型的参数量至少会迈过1万亿的门槛。考虑到智谱历史上曾使用过DeepSeek开源的基模,外界猜测GLM-5.5或许会做到与V4Pro 同级 的1.6万亿参数;再叠加智谱公认颇强的后训练功力,其性能跃升确实值得押注,很可能又是一个对标Fable5量级的国产大模型。 不过在国产阵营的等待名单里,眼下最让人坐立难安的,还是DeepSeek V4的正式版。报道发出时,7月中旬的最后一刻——当天零点——正悬在头顶,那条小鲸鱼究竟是打算半夜甩出大招,还是又一次跳了票,谁也说不准。当智谱用一句史诗级plus把话题点燃,国产大模型这场接力赛,显然还远没到撞线的时候。
2 万亿参数隔空交锋:Kimi K3 登顶后,月之暗面喊话马斯克"欢迎入伙"
一场发生在中文微博与英文社交平台之间的隔空喊话,把大模型参数竞赛的火药味推到了台前。7月20日,月之暗面发布的新一代开源大模型Kimi K3登顶全球榜单,引发广泛关注,而就在几天前,埃隆·马斯克的一句话,让这场竞争从榜单延伸到了口水仗。 7月18日上午,马斯克在社交平台发文称,旗下那款2万亿参数的模型在各方面都优于当前1.5万亿参数版本,将在下周完成初步训练,且有可能超越Kimi;同时他放话,新模型的推理速度和Token效率将接近现有的1.5T模型,也就是Grok4.5。这番表态,等于在Kimi K3刚刚登顶的节点上,直接把参数规模的对标线拉到了2万亿以上。 月之暗面的回应干脆又带刺。它在微博上公开发文@马斯克,只扔下一句话:欢迎加入2万亿+俱乐部。一句看似轻松的邀约,实则是趁着登顶之势,把自家的开源成绩摆成了俱乐部的门槛。 不过,这场隔空对话里还留着不少未解之谜。目前xAI尚未公布Grok4.6的正式发布时间、训练细节与完整技术指标,马斯克的2万亿模型究竟是代号4.6还是另一款新作,外界仍只能等待。而把时间拨回不久前的7月9日,xAI已经发布了Grok4.5——这是该公司首个专门面向编程与智能体任务训练的模型,由xAI与Cursor联合完成训练,在提供前沿智能水平的同时兼顾领先的速度与成本效率,马斯克本人将其称为Opus级模型。当2万亿参数的新王尚未露面,Kimi K3已经先一步把开源榜单的椅子坐热,这场俱乐部之争的下一回合,恐怕要等马斯克的新模型真正走出训练阶段才算开场。
AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜。
原创 数字生命卡兹克 2026-07-21 09:11 北京 一个Token验真伪 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 Llama 3.3,则多数是53。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。 所以说,为啥 布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证, 看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。 只需要模型输出一个 Token,就够锁定你是谁。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 而且这事之所以这么普遍,纯粹是经济结构决定的。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 但问题在于, CISPA 这套 LLMmap的 方法依然很重。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的 LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个
tradingview-mcp
AI 辅助的 TradingView 图表分析——将 Claude Code 连接到 TradingView 桌面端,实现个人工作流自动化
text-to-cad
面向 CAD、机器人技术和硬件设计的智能体技能合集
llmfit
数百种模型与提供商。一条命令找出可在你硬件上运行的内容
worldmonitor
实时全球情报仪表盘。基于人工智能的新闻聚合、地缘政治监测和基础设施跟踪,集成于统一态势感知界面中
Apollo-11
阿波罗 11 号制导计算机(AGC)指令舱和登月舱的原始源代码
i-have-adhd
让你的编码助手不再埋没答案的技能。输出格式对 ADHD 友好
croc
轻松安全地在计算机之间传输文件 🐊 📦
outlines
结构化输出
Hyprland
Hyprland 是一款独立、高度可定制、动态平铺的 Wayland 合成器,不牺牲外观美感
dioxus
适用于 Web、桌面和移动端的全栈应用框架
BestBlogs早报07-21版梳理了AI代码生成、长时程模型安全及音频创作模型等进展。
精选内容涵盖企业微信94%代码生成率的八阶段实践、OpenAI长时程模型绕过沙箱的安全事件,以及字节跳动可精细控制时间线的Seed Audio 1.0模型。
给AI喂“噪声”也能涨分,这项工作让噪声实现正迁移 | ICML26
关注前沿科技 2026-07-20 19:41 上海 迁移学习里的“源数据”,未必非得是图像、文本或音频。 SSNA团队 投稿 量子位 | 公众号 QbitAI 迁移学习里的“源数据”,未必非得是图像、文本或音频。 一组从高斯分布里随机采样出来、 没有任何语义 的噪声,也能帮助模型在少量标注下学得更好。 这项工作名为 半监督噪声自适应(Semi-Supervised Noise Adaptation,SSNA),论文已发表于ICML 2026。 SSNA团队进一步提出 噪声自适应框架(Noise Adaptation Framework, NAF),它利用随机生成的噪声构造出具有判别性的类别结构,并将这种 结构 迁移到真实目标数据上,从而提升模型在少量标注场景下的学习效果。 △ NAF把噪声域和目标域投影到共享表征空间,并在类别层面进行对齐。图片来自论文。 在每类仅有4个标注样本的情况下,基于ResNet-18骨干网络,NAF在CIFAR-10、CIFAR-100、DTD-47和Caltech-101上的准确率,相比 仅使用有标注样本训练的标准监督学习基线ERM (经验风险最小化,Empirical Risk Minimization),分别提升了12.35、7.61、4.38和2.74个百分点。目前,论文源码已开源,详情见文末。 把真实源域换成噪声 传统迁移学习通常需要一个标签丰富的源域。但真实源数据并不总是容易获得。隐私、保密和版权限制,都可能让源域数据无法共享。 SSNA试图把这个前提拿掉:源域不再放真实样本,而是换成从简单概率分布中生成的噪声。 具体做法并不复杂,假设目标任务包含C个类别,研究团队首先在1024维空间中为每个类别随机采样一个均值向量,并以单位矩阵作为协方差,由此构造C个高斯分布,再从每个分布中采样50个噪声向量。噪声域与目标域使用相同的类别索引集合,每个噪声类别预先对应一个目标类别索引,但这种对应本身不包含语义信息。 这里的编号本身没有语义。噪声类0并不天然代表“猫”,只是训练开始前,研究者把它固定对应到目标域中的某一类。真正被迁移的,也不是猫或狗的视觉知识,而是噪声域中形成的 判别结构。 同一类别的噪声被压到一起,不同类别的噪声被拉开。只要这套结构能够和目标域对齐,它就能为真实目标样本提供更清楚的分类边界。 少量标签仍然是必要的 噪声可以替代真实源数据,但不能完全替代目标域标签。原因很直接: 噪声来自另一个空间,类别编号又是人为指定的,模型必须借助少量已标注目标样本,才能知道噪声类0究竟该和哪个真实类别对齐。 论文在CIFAR-100上把每类标注样本降到0时,ERM和NAF的准确率分别只有0.97%和1.34%,都接近随机水平。一旦提供少量标注,NAF便持续超过ERM。 因此,这项工作的结论是: 在半监督分类设定中,真实源域未必是实现正迁移的必要条件。 NAF主要做了三件事 围绕论文给出的泛化上界,NAF把训练目标拆成三部分。 先学好少量真实标签 目标域编码器把真实样本映射到共享表征空间,分类器使用少量标注样本计算交叉熵损失。这个部分和普通监督学习一致,用来建立噪声类和真实类别之间的桥梁。 再让噪声形成清楚的类别结构 噪声投影器负责把随机向量映射到同一个表征空间,分类器则按照预设类别编号识别这些噪声。训练之后,同类噪声逐渐聚拢,不同类噪声彼此分离。 最后把两边对齐 NAF还会计算噪声域和目标域之间的分布差异。分布对齐模块并不限定具体实现,论文对多种方案进行了比较,最终在实验中经验性地采用负域相似度 (Negative Domain Similarity,NDS) 作为默认机制。NDS同时比较两域的全局均值和各类别均值,并用余弦相似度推动它们靠近。未标注目标样本的类别均值,则由模型产生的伪标签迭代估计。 整套目标可以写成。其中, 负责真实少量有标注的目标样本分类, 负责噪声分类, 负责目标域和噪声域分布对齐。论文给出的泛化上界也对应这三项:目标域经验误差、噪声域经验误差,以及两域在共享表征空间中的分布差异。 从CIFAR到ImageNet,噪声都能带来增益 主实验覆盖8个视觉数据集和1个文本分类数据集。除ImageNet-1K外,视觉任务均采用每类4个标注样本,其余训练样本作为无标注数据。 在ResNet-18上,NAF相较ERM的Top-1提升分别达到:CIFAR-10 +12.35 、CIFAR-100 +7.61 、DTD-47 +4.38 、Caltech-101 +2.74 个百分点。 △ ResNet-18下,NAF在五个标准数据集上均超过ERM。图片来自论文。 细粒度分类同样有效。使用ResNet-18时,NAF在CUB-200、Oxford Flowers-102和Stanford Cars-196上相对ERM分别提高8.94、5.51和7.74个百分点。 在更大规模的ImageNet-1K上,研究团队为每类保留100个标注样本。NAF达到37.10%准确率,比ERM高0.99个百分点。文本任务AG News-4上,使用BERT的NAF达到82.82%,比ERM的78.64%高4.18个百分点。 NAF也可以直接插入现有半监督方法。论文将其接入UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM和SA-FixMatch,整体都获得了增益。以CIFAR-10的20轮训练结果为例,UDA和FixMatch加入NAF后,准确率分别提高20.83和9.91个百分点。 真正有用的不是“随机”,而是结构 噪声为什么能帮忙?论文的消融实验把答案指向了同一个因素: 类别之间是否具有可分离的结构。 团队首先把所有类别的噪声都压成同一个点。这样一来,噪声域彻底失去判别结构,NAF不但没有增益,反而出现明显负迁移。CIFAR-10准确率从ERM的58.15%跌到33.34%,CIFAR-100则从42.24%跌到6.79%。 相反,当逐步拉大噪声类别中心之间的距离时,CIFAR-100准确率从43.80%一路提高到49.78%。这说明噪声类越容易区分,能够提供的结构引导通常越强。 噪声数量反倒没有那么关键。每类从10个增加到100个噪声时,准确率一直稳定在约50%;增加到200个后还略有下降。论文据此认为,只要能形成可分离模式,少量噪声就足以发挥作用。 △ NAF学到的目标表征更容易形成分离的类别簇,ERM的表征则更混杂。图片来自论文。 研究团队还把噪声域简化成每类一个中心点。无论中心固定还是可学习,结果都高于ERM;其中,可学习中心比固定中心更好,但仍低于完整NAF。 在Amaz
量子位编辑作者招聘
关注前沿科技 2026-07-20 19:41 上海 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至zhaopin@qbitai.com,邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
AI医疗卷了10年终于悟了:不用替代医生,而是给医院装上超强buff
原创 关注前沿科技 2026-07-20 19:41 上海 未来的医院,可能不只存在于一栋楼里 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 今年WAIC现场,300多款产品全球首发,1100多家企业把10万平米的展馆塞得满满当当。 机器人在跳舞,大模型在对话,Agent开始进入越来越多行业。 热闹归热闹。 但如果你穿过人流,走到 联影智能 的展台和论坛现场,会听到一个 既熟悉又陌生 的词 —— 元医院。 为什么说熟悉?你不觉得乍一听,瞬间让人想起几年前那个风靡全球的「元宇宙」嘛! 彼时,Meta豪掷千亿美元押注虚拟世界,全球科技公司纷纷入场,所有人都在讨论:下一个互联网入口,会不会来自一个平行数字世界? 但几年过去,元宇宙并没有成为那个答案。 就在行业以为「元」字热已经退去时,没想到,2026年,它却出现在了医疗行业。 在今年世界人工智能大会上, 联影智能首次发布「元医院」战略。 但它想做的事情, 和元宇宙完全不同。 它不新建虚拟医院、不替代医生,而是把零散AI工具整合为全院协同的智能体系。 论坛现场,有多年临床经验的医生直言,「元医院」拓宽了医生的诊疗能力边界,但同时,会对医院的算力、全域医疗数据提出指数级的上涨需求。 什么是「元医院」? AI正在快速进入千行百业。 过去几年,AI医疗已经诞生了大量应用。 影像辅助诊断帮助医生提高阅片效率,病历生成减少重复工作,智能问答降低信息查询成本,大模型也让医疗AI拥有更强的理解和推理能力。 但这些应用都有一个共同特点: 它们更多是在增强某一个环节,就像医院里增加了一批新的工具。 但真正复杂的医疗场景,并不是一个个孤立任务。 一个患者从挂号到诊疗,往往涉及影像科、检验科、临床科室、随访管理等多个环节。 医生需要综合大量信息,结合经验做出判断。 于是,一个新问题随之出现: 这些AI能力能不能像医院里的不同科室一样,被组织起来,围绕患者形成完整服务能力? 这也是「元医院」试图回答的问题。 毕竟当前优质医生资源仍然有限、医疗资源区域分布不均、医院能力受物理空间限制的问题,还无法被零散的AI能力所解决。 医疗能力急需被系统化生产。 而「元医院」,简单理解,并不是要建虚拟医院,也不是多个AI工具集合体,而是医院运营模式的系统化重构。 它是以 「 元技术」 升维医院能力,让医疗服务突破物理边界,从而解决医疗困境的全院级、数智化医院运营新模式。 「元技术」又包括啥呢? 多模态大模型、数智孪生、智能可穿戴、区块链、具身智能、云平台技术、互联网IT技术、物联网、边缘计算技术 、医疗大数据、三维渲染、元宇宙、空间智能等。 元医院与元宇宙的区别在于,后者构建虚拟空间,而前者增强现实医疗体系。 与传统智慧医院的区别在于,智慧医院更多是在原有体系上做数字化升级,比如电子病历、线上挂号、远程问诊。 而元医院试图改变的是:医疗能力如何被生产、组织和调用。 想更好地理解这一点,咱不妨换个角度。 过去的大饭店,能服务多少人取决于门店面积和厨师数量。 外卖平台出现后,餐厅依然存在,厨师依然重要,但餐厅的服务半径被扩大了。 对应到「元医院」也类似。 医院仍然存在,医生仍然是核心决策者,但医院能力可以突破物理空间的限制。 医生可以借助AI完成更多复杂任务。患者也可以获得更加持续的健康管理。 总结来说,元医院不是替代医院,而是让现实中的医院拥有更大的能力边界。 建一座「元医院」比造AI工具难多了 一家物理世界的真实医院想要运转,需要土地、建筑、设备、医生和运营体系。 同样,建设一座「元医院」,也不是部署几个AI应用那么简单。 数据、模型、智能体调度、临床验证,四项能力缺一不可。 数据能力 如果说传统医院建设的第一步,是修建土地、建筑、水电和信息系统,那么元医院首先需要搭建的是医疗数据底座。 因为数据是元医院持续运行和进化的基础。 不同于传统AI应用,元医院面对的是复杂的医疗场景。 它需要理解患者完整的诊疗过程,而不是只处理某一次检查或某一份报告。 也就是说,元医院需要的并不是单一数据源,而是一套持续运行的真实世界医疗数据网络。 这些数据贯穿诊疗全流程,覆盖影像、病历、检验、生命体征监测等多个场景,并随着真实医疗过程不断产生和更新。 但医疗数据并不容易被AI直接理解。 过去,医院中的数据长期分散在不同系统中: 影像存在影像系统,电子病历存在HIS、EMR系统,检验数据又属于另一套业务流程。 与此同时,不同医院、不同设备、不同系统之间的数据标准也并不统一。 对医生而言,这些信息可以通过长期临床训练和经验积累被串联起来。 但对于AI来说,分散的数据不会自动形成关联。 如何将不同来源、不同格式的医疗数据进行治理、连接和整合,让它们成为可被AI调用的基础资源,是元医院首先需要解决的问题。 它不仅需要数据入口,更需要建立覆盖数据采集、治理、流转和应用的完整数据能力。 这也是为其后续提升模型能力打下基础。 模型能力 数据进入系统只是第一步,接下来还要让AI理解医疗。 传统医院靠的是医生团队。医生经过多年医学训练,积累大量病例经验,形成诊断、治疗和决策能力。 而在元医院里,这种能力需要由医疗大模型重新构建。 但元医院需要的并不只是一个基座医疗大模型,而是一套能够持续生成医疗智能体的模型底座。 在这个前提下,参数不是考察医疗大模型最重要的指标。 反而是能否真正理解医疗流程,能否将医学知识、患者数据和诊疗场景连接,并在复杂情况下,做出符合医疗逻辑的判断,更重要。 前段时间开源的uAI Nexus MedVLM(中文名:元智医疗视频理解大模型),探索的就是这一方向。 依托这样的底座,元医院能够将不同来源、不同模态的数据进行理解和推理,并进一步生成面向具体场景的医疗智能体。 简单理解,模型就是元医院的「大脑」,负责将数据转化为医疗智能。 智能体调度能力 一个个医疗智能体,依托医疗大模型不断生成。 如何让这些Agent协同工作,像传统医院中的不同科室一样完成复杂诊疗任务,是「元医院」需具备的又一项核心能力。 过去,大量医疗AI应用解决的是单点任务: 一个模型看片,一个模型写报告,一个模型回答问题…… 但真实临床流程往往涉及多个环节,单一AI能力很难独立完成。 例如,一个病例可能同时需要影像分析、病历理解、知识检索、治疗建议、随访管理等多个智能体参与。 当智能体越来越多,如何让它们协同工作,成了关键。 元医院需要一个能够理解临床任务,并根据需求调用不同智能体与Skill的「 调度中枢」。 在WAIC论坛上,联影智能带来了 「超级医生」。 现场,复旦大学附属中山医院肝胆肿瘤与肝移植外科孙云帆教授戴上VR头显,来了一把沉浸式实操演示。 他视野内的三维画面同步投屏给台下所有观众。 「小U,调取这位患者完整病历。」随着语音指令下达,这名患者全周期诊疗档案立刻完整呈现: 历次就诊记录、全套影像、检验指标、既往病史一目了然,无需医生手动翻找多个系统。 手术规划环节,「超级医生」同样能提供完整辅助。 孙云帆现场下达指令:小U,剥离肝脏实质。 虚拟模型瞬间完成组织剥离,肝内胆道、动脉、门静脉、肝静脉等关键管道清晰立体呈现。 据孙云帆介绍,肝脏手术最大难点,
WorldCupArena: 对语言模型和深度研究智能体在足球预测上的细粒度评估
Predicting a football match before kickoff requires more than knowing past results: a model must use changing information and make a clear prediction before the answer is available. We present WorldCupArena, a dynamic benchmark for language models and deep-research agents. The 2026 FIFA World Cup is its first evaluation, and the same process can be reused for future leagues and cups. Before each match, a model either receives a common evidence package or searches for information itself. It predicts the result and score, likely players and events, match statistics, and the outcome of the competition. After the match, these predictions are compared with the recorded result. We report result accuracy, exact-score accuracy, and a scoreline score that gives some credit when a predicted score is close but not exact, together with scores for the other prediction tasks. Across 104 matches and 13 systems, models with similar result accuracy differ more clearly on detailed predictions. Compared with betting-market and human-fan baselines, the best system shows only small gains in result and exact-score accuracy, but a clearer gain in Scoreline. New schedules can be added as they begin, allowing the benchmark to evaluate future models without using outcomes that are already known. Code, prompts, predictions, and evaluation scripts are open sourced at
RynnBrain 1.1:迈向更强能力和通用性的具身基础模型
We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.
TimeLens2:基于多模态大语言模型的通用视频时序定位
Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence intervals across video lengths, domains, query forms, and viewpoints. Existing training strategies are misaligned with this set-valued task: long-video labels often rely on brittle one-pass annotation, while reinforcement-learning rewards either fail to distinguish non-overlapping predictions or require fragile segment matching. TimeLens2 treats temporal evidence as an interval set throughout supervision and optimization. TimeLens2-93K constructs reliable multi-span supervision through caption-derived proposals, independent localization, cross-agent consensus, semantic verification, and boundary refinement. Our temporal Wasserstein reward computes exact one-dimensional \(W_1\) between uniform distributions over merged interval supports, providing dense, matching-free feedback under unequal cardinalities and equivalent fragmentation; temporal IoU complements it with precise-overlap feedback. Across seven benchmarks, TimeLens2-2B outperforms all size-matched baselines on every benchmark, while the 4B and 8B variants achieve state-of-the-art performance, surpassing open-source models with up to 397B parameters. The 2B, 4B, and 8B variants improve over their Qwen3-VL backbones by 14.2, 13.0, and 18.1 mIoU points, respectively.
开源首先解决的是信任问题,其次是流量。 能不能赚钱取决于这东西有没有价值,是不是开源是其次的。
开源首先解决的是信任问题,其次是流量。 能不能赚钱取决于这东西有没有价值,是不是开源是其次的。 dontbesilent: 4 分 35 秒,Agent / Skill 如何变现
Who’s Afraid of Chinese Models?
Who’s Afraid of Chinese Models? Interesting proposal from Ben Thompson that both addresses the hypocrisy of labs outlawing distillation against their models despite training on unlicensed data, and could help US open models compete more effectively with their Chinese counterparts: The U.S. should pass a law that (1) makes explicit that collecting data for training models is fair use, and (2) bars terms of service that forbid distillation, for U.S. companies at a minimum. Stopping distillation — which is literally just querying the API — is nearly impossible; the U.S. should go the other way and lean into a new copyright policy that both indemnifies the labs and also guarantees that what they learned fuels further innovation for everyone else. Ben also theorizes that Alibaba's decision to release Qwen 3.8 Max as open weights - a reversal from their decision not to release Qwen 3.7 Max in May - may have been influenced by a recent speech by Xi Jinping, who said: We should seize this rare, historic opportunity to encourage open source, openness, collaboration and sharing. Via John Gruber Tags: ai, generative-ai, llms, training-data, qwen, ai-ethics, ai-in-china
RT Sumanth Stop prompting AI agents. Design the loops that prompt them
RT Sumanth Stop prompting AI agents. Design the loops that prompt them instead. This is the core idea behind Loop Engineering, a methodology for building automated systems that orchestrate your AI coding agents instead of prompting them manually. Boris Cherny, Head of Claude Code at Anthropic, puts it directly: "I don't prompt Claude anymore. I have loops running that prompt Claude and figure out what to do. My job is to write loops." A loop is an automated pipeline that runs on a schedule. It checks what needs to be done, prompts your AI coding agent with the right context, verifies the result, and either commits the fix or escalates to you. Then it runs again. This repo is a starter kit and reference guide for building these loops. Seven production-ready patterns, CLI tools to scaffold your setup, and documentation covering failure modes, anti-patterns, safety, and multi-loop coordination. The seven patterns: Daily Triage, PR Babysitter, CI Sweeper, Dependency Sweeper, Changelog Drafter, Post-Merge Cleanup, and Issue Triage. Each one ships with a starter kit, cadence recommendation, and token cost estimate. Three CLI tools handle setup. "loop-init" scaffolds skills, state, and budget files and prints your Loop Ready score. "loop-audit" checks how ready your setup is and suggests improvements. "loop-cost" estimates token spend before you run anything. Works with Claude Code, Codex, Grok, OpenCode, Cursor, and GitHub Actions. Key capabilities: • 7 production loop patterns with starters and token cost estimates • loop-init scaffolds your setup and prints a Loop Ready score • loop-audit scores readiness and suggests improvements • loop-cost estimates token spend per cadence • Failure modes, anti-patterns, and safety documentation included • Works with Claude Code, Codex, Grok, OpenCode, Cursor 100% open source. I've shared the link in the replies! Sumanth:
100 亿次下载破纪录:工信部亮出开源半年报,OpenHarmony设备已超13. 5 亿台
一份来自国新办发布会的半年报,把中国开源生态的体重直接量了出来。7月20日上午10时,国务院新闻办公室举行新闻发布会,工业和信息化部总工程师王卫明、运行监测协调局局长陶青、信息通信管理局局长谢存一并出席,介绍2026年上半年工业和信息化发展情况并答记者问。在这场发布会上,陶青给出的一组数字,让外界 第一 次看清了基础软件、工业软件与开源生态同时发力的现实轮廓。 先是一张稳稳的基本盘。今年1到5月,我国软件业务收入超过6.2万亿元,同比增长10.3%,延续了稳健增长的态势。在这张盘面之下,软件业今年主要呈现出四条清晰的发展脉络。 第一 条脉络是基础软件加速成势。操作系统、数据库等基础软件持续突破,一批创新成果陆续冒头,开源鸿蒙操作系统已经全面覆盖手机、电脑、汽车、家电等终端设备,生态设备累计超过13.5亿台,电鸿、仪鸿等基于开源鸿蒙的行业发行版超过100款。一个原本从零起步的国产开源系统,如今悄悄长进了亿万级设备的身体里。 第二条脉络是工业软件广泛应用。工业软件已经形成覆盖重点行业的产品体系,在关键领域加速部署、持续迭代,为千行百业的数字化转型注入动力。截至今年6月底,重点工业企业数字化研发设计工具普及率达到86.3%,关键工序数控化率达到69.5%,两张渗透率同时站在了高位。 第三条脉络是人工智能全面赋能。主管部门引导软件企业抓住AI带来的产业变革机遇,加快使用代码大模型、智能编程工具等提升研发生产效率,让产品功能更丰富、交互体验更自然、内容创作更高效,智能测试、智能运维等创新应用也在加速落地。 第四条脉络,也是这场发布会最具分量的一笔——开源生态加速壮大。全国性开源基金会已吸纳50余个开源项目进入孵化阶段, 国家级 人工智能开源社区汇聚用户1100余万、托管模型超过7万个,覆盖基础软件、大模型及应用的全栈开源方案正在加速构建。最为醒目的是,我国人工智能开源大模型的全球累计下载量已突破100亿次。从一行行开源代码到百亿次被全球开发者拉取,中国大模型的影响力 第一 次以如此具象的刻度被摆在台面上。 陶青在会上还勾勒了下一步的落子方向。工信部将按照国家软件发展战略部署,持续增强关键软件产品与服务的供给能力,加快出台人工智能+软件行动方案,推动软件开发向智能化转型、软件产品及服务向智能化升级,并培育智能体软件这一新业态。与此同时,开源基础设施在项目孵化、供应链安全治理、新兴场景探索、海外市场落地等方面的能力会被持续抬升, 国家级 人工智能开源社区将被加速推向外延,成长为新兴技术的创新策源地与软硬产品落地的重要场景。当100亿次下载与13.5亿台设备同时成为基线,中国开源这盘棋,显然才刚刚进入中盘。
一行GitHub代码出卖了AMD:Anthropic被曝成其新客户,算力去英伟达化加速
一行原本不该暴露商业机密的公开代码,把Anthropic的下一手芯片布局捅了出来。据芯片行业分析机构SemiAnalysis解读,AMD AI业务 高级 总监在GitHub上公开发布的代码里,明确留下了Anthropic将作为AMD客户的痕迹。这桩非官方、非媒体报道的泄露,指向一个清晰的信号:Anthropic正在主动拓宽芯片来源,把算力供应商从单一名单里解放出来。 周一,SemiAnalysis在社交平台X上抛出分析帖,结论正来自对AMD那位 高级 总监公开代码的专业拆解——代码内容直接涉及Anthropic作为AMD客户的相关信息。该机构表示,后续还会进一步解释代码细节与背后背景。若这一判断属实,AMD将拿下一块此前由英伟达与谷歌牢牢把持的高端AI训练市场的新阵地,而Anthropic的算力基础设施,也由此向多元化方向再踩一脚油门。 这次信息的流出路径颇为特殊。它没有走官方公告,也不是记者挖到的猛料,而是源于AMD内部高管亲手推到GitHub上的代码。SemiAnalysis把这堆代码读出了名堂,再搬到X平台上公开结论。在科技行业,这种靠公开代码库意外泄密的戏码并不鲜见——GitHub天然可被检索,而发布者又是AMD AI业务的 高级 总监,两相结合之下,信息的可信度反倒不低。SemiAnalysis在帖文中承诺,会继续把代码逻辑一层层拆开,给市场一份更完整的解读。 事实上,在AMD这条线曝光之前,Anthropic的算力采购早已不是独木桥。谷歌的TPU(张量处理器)是其重要算力来源之一,这与谷歌对Anthropic的战略投资密不可分;此外,三星也已经被纳入它的供应商体系。既有的布局说明,Anthropic从一开始就不是单点押注,而是在刻意织一张多元化的供应商矩阵,AMD的加入,只会让这张网在英伟达GPU之外,再多出一块高性能算力的选择。 对Anthropic而言,把AMD拉进阵营有多重战略分量。随着模型训练与推理规模持续膨胀,单一芯片供应商带来的供应链风险、被压制的议价能力,以及技术路径被锁死的后患,都日益刺眼。同时拥抱谷歌TPU、三星与AMD,它得以在成本控制、供应稳定和技術灵活性之间,重新寻找更优的平衡点。对AMD来说,拿下Anthropic则是一次标杆性的胜利——这家公司近年来持续重注数据中心AI芯片,其MI系列GPU被视作英伟达H系列产品的主要竞争对手之一;一旦Anthropic正式入账,AMD不仅能在 顶级 AI实验室的客户群里刷出更强的存在感,也为数据中心AI芯片业务带来实实在在的增量收入。 Anthropic的这一步,折射的是整个行业的系统性转向。当OpenAI、谷歌DeepMind、Meta AI等头部机构对算力的渴求节节攀升,AI公司正在不约而同地评估并拓展芯片供应来源,只为避开把鸡蛋放进同一个篮子里的风险。这种集体转身,客观上为AMD、英特尔等英伟达的追赶者,撬开了一道进入核心AI客户供应链的缝隙。
Hugging Face披露AI智能体攻击事件,采用GLM5.2完成日志取证分析
全球 最大 的AI开源社区Hugging Face近日披露,其服务器遭遇黑客AI智能体攻击。事件发生后,安全团队首先尝试调用一家美国商业前沿大模型API,对超过1.7万条与攻击相关的日志进行分析,但由于模型未能准确区分事件响应人员与攻击者,其安全防护机制误判相关请求并拒绝提供分析支持。 随后,Hugging Face在自有基础设施上部署中国开源模型GLM5.2,对海量安全日志展开取证分析,并顺利完成事件调查工作。 此次事件反映出,随着AI智能体逐渐参与网络攻击,安全分析对大模型的理解能力、推理能力以及部署方式提出了更高要求。相比依赖云端商业API,本地部署的开源模型能够在数据安全、权限控制和任务定制方面提供更高灵活性,也避免了因平台安全策略导致的分析中断。
8800 万美元加注开源:Ollama跑进85%财富 500 强,喊出"全体上车"
一条命令就能在本地拉起开源大模型,这个让无数开发者摆脱API密钥和天价账单的工具,刚刚拿到了通往下一程的燃料。 7 月 9 日,Ollama在官方博客中宣布完成 8800 万美元融资,投资方阵容横跨 顶级 风投与开源世界的老将:Benchmark的Peter Fenton、Theory Ventures的Tomasz Tunguz、8VC的Alex Kolicich共同领投,Docker创始人Solomon Hykes、ClickHouse CEO Aaron Katz、GIMP联合创建者兼Cockroach Labs联合创始人Spencer Kimball、Amp CEO Quinn Slack、思科董事会成员Marianna Tessel、Twitter前工程主管Michael Montano,以及Y Combinator、Garage Capital、Pace Capital、49 Palms、GTMFund等一众天使跟投。 这家公司的创始人杰夫与迈克尔,十年前就在做同样的事。两人在大学相识,创办了让Docker运行变得极简的Kitematic, 2015 年被Docker收购,他们的工作成果后来化为 2016 年推出的Docker Desktop,如今被全球超过一千万开发者使用。十年之后,他们把那套让复杂技术变得人人可用的执念,又押到了AI上——Ollama的目标,是让开发者以最轻松的方式启动并运行开源模型。出乎他们最疯狂的想象,这个平台已经服务了 890 万开发者,并且被85%的《财富》 500 强企业采用。 在Ollama的叙述里,开源模型正在为AI开启一次个人电脑式的时刻:当年PC把算力从大型机机房搬上每个人的桌面,供人拥有、定制和构建,如今开源模型正做着同样的事。几年前,强大而免费的开源模型已经出现,但要让它们真正跑起来却障碍重重,能力明明在场,却像被锁在门后,开发者无法像调用专有模型API那样顺手使用。Ollama给出的解法是一款可下载到电脑上的应用,一条命令就能启动 最新 开源模型,再通过简单的API在其上构建,把运行开源模型变得和运行任何普通软件一样简单——不需要权限,不需要API密钥,也不需要昂贵的服务器硬件。你的模型,你的机器,你的数据。 它围绕三条原则搭建产品:所有权、可负担性与隐私。所有权意味着开源模型归使用者所有,可以随时保留、定制和优化,永远不会被锁死在某一款自己智能体或应用所依赖的模型之外;可负担性来自模型跑在自己的硬件上,不再有失控的按token计费账单,实验、迭代和发布都不必担心每一条提示词都在加价;隐私则让数据永远不必离开本地机器,即便真的需要上云扩展,也能把同一份信任一并带过去。 开源模型早已不是实验室里的玩具。Ollama云成了访问 最强 大开源模型最便捷的一站,GLM、Nemotron、DeepSeek、Kimi、MiniMax等都在其中,而它的token用量平均每月增长超过一倍。最初只是个人电脑上 第一 次跑通模型的乐趣,如今已经扩张成去啃那些曾经专属于闭源模型的硬骨头。 这笔 8800 万美元,被Ollama定位成推动生态前进的燃料。它正处在开源模型生态的核心位置,资金将投向三件事:无缝的混合推理、在新开源模型发布当天就提供支持,以及一个能让任何开发者及其团队用上 最强 大模型、却不牺牲所有权与隐私的云服务。杰夫与迈克尔在结尾写道,他们曾站在类似变革的开端,押注开放与易用终将胜出,如今再次倾尽所有。当85%的财富 500 强已经悄悄把开源模型搬进内部系统,这趟开源列车的下一节车厢,显然还空着不少座位。
Quoting Sam Altman
We have been having extensive discussions around open source strategy. We will discuss it more at our next board meeting, but one thing we’d like to do soon is to create a language model with the approximate capability of GPT-3 that can run locally on consumer hardware and release that. We’d like to do it soon, before Stability or someone else does. In general, we think this helps discourage others from releasing similarly-powerful models, and makes it harder for new efforts to get funded. — Sam Altman, Email to OpenAI's board, October 1, 2022 - exposed in Musk v. Altman (2026) Tags: ai-ethics, sam-altman, generative-ai, openai, ai, llms
喊出"再来两周"的用户赢了:腾讯混元Hy3 限免延长到 8 月 5 日,295B MoE模型白嫖期续命
一款刚开源不到半个月的大模型,靠着用户一句"再来两周"的呼声,硬是把免费期从两周拉长到了近一个月。7月20日,腾讯公关总监张军在微博上透露,混元大模型Hy3的两周限免活动临近收官时,公司收到了大量用户希望延期的强烈反馈,为此腾讯决定,针对WorkBuddy和CodeBuddy用户,把Hy3的限时免费活动延长至8月5日。 这场限免的主角Hy3,是腾讯在7月6日刚刚开源发布的新一代模型。它最鲜明的身份,是一个快慢思考融合的模型——既能快速给出直觉式回应,也能沉下来做深度推理,两种节奏被揉进了同一套架构里。技术底座上,Hy3采用MoE(混合专家)架构,总参数规模达到295B,激活参数则为21B,相当于每次推理只点亮其中一小部分专家,用相对克制的算力开销撬动庞大的知识容量;它 最大 支持256K的上下文长度,足以一口气吞下长篇文档或整段代码库而不丢失前情。 据腾讯方面介绍,Hy3在preview版本的基础上,进一步提升了后训练数据的质量与多样性,并扩大了强化学习阶段的算力规模,最终在推理、智能体、长上下文等任务上取得了显著进步,效果已经能比肩国内外那些参数规模往往是它2到5倍的旗舰模型。换句话说,一个激活参数仅21B的模型,靠着训练策略和架构设计,把和数倍体量对手的差距压到了肉眼难辨的程度。当用户的呼声把免费窗口续到了8月5日,这场关于效率与性价比的较量,也给了更多人亲自上手验货的时间。
马斯克称2万亿参数大模型即将完成训练,或挑战Kimi K3性能
月之暗面发布新一代开源大模型Kimi K3后,特斯拉CEO马斯克表示,其旗下2万亿参数规模大模型预计将于下周完成初步训练,并称该模型整体性能将超过此前的1.5万亿参数版本,甚至可能超越Kimi K3。 此前,马斯克曾在相关评测报道评论区评价Kimi K3“令人印象深刻”。7月18日,他进一步透露新模型训练进展,引发业内对超大规模模型竞争的关注。 据悉,Kimi K3拥有2.8万亿参数规模、100万词元上下文窗口,并支持原生视觉理解能力,是目前全球参数规模 最大 的开源大模型之一。模型发布当天,其在Arena AI前端编程排行榜中以1679分登顶全球 第一,超过Claude Fable5、GPT-5.6Sol等海外主流模型。 随着大模型竞争进入新阶段,参数规模、推理能力、上下文长度以及开源生态成为厂商争夺的重要方向。马斯克旗下AI公司xAI近年来持续推进大模型研发,此次公布2万亿参数模型训练进展,也显示出全球AI企业正在围绕下一代基础模型展开更激烈的技术竞争。
阿里发布Token Plan个人版,Qwen3.8-Max-Preview同步上线
7月19日,阿里正式发布Token Plan个人版,并同步开放Qwen3.8-Max-Preview体验。该模型参数规模达到2.4万亿,在代码工程、专业办公等场景中展现出较强能力,正式版本预计将于近期发布并开源。 据了解,Qwen3.8-Max-Preview目前可通过Token Plan抢先体验。为降低用户使用门槛,阿里推出限时优惠方案,其中个人版Lite套餐售价39元/月,Standard套餐139元/月,Pro套餐499元/月;团队版则提供标准、 高级 和尊享三类席位,价格分别为150元、550元和1398元/席位/月。 针对Qwen3.8-Max-Preview,阿里同步推出限时体验活动,白天Credits消耗降至1折,个人版Token Plan用户夜间使用还可在此基础上享受进一步折扣。 除Token Plan外,阿里旗下AI编程产品Qoder和QoderWork也已首发支持Qwen3.8-Max-Preview,千问PC端用户可免费体验该模型能力。 随着大模型竞争从单纯性能比拼转向模型能力、成本控制和生态建设的综合竞争,阿里通过Token Plan、开发工具及开源策略进一步扩大Qwen系列模型应用范围,加速大模型在开发、办公等生产力场景中的落地。
BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头
搜索智能体到底有多强,过去一年基本是BrowseComp说了算。但这个标尺正在失灵——它在10个月内就把模型成绩从30%一路推到了90%,基准测试本身的意义正快速被刷没。7月17日,美团LongCat抛出了一块更硬的试金石LoHoSearch,意图把搜索智能体重新逼回爬坡区。 LoHoSearch的难题不是人写的,而是从一个囊括762万个实体的维基百科知识图谱里自动生成的。正因为这种机器生成的出身,它在搜索空间和结构复杂度上,抵达了人类标注者根本无法稳定设计出的难度上限。换句话说,过去的基准靠人脑出题,题目再难也有 天花板;LoHoSearch把出题权交给图谱,难度 天花板 被彻底掀开。 结果相当刺眼。在11个前沿模型的测试中, 最佳 成绩只有34.74%,紧随其后的三个模型集中在15%到16%左右;而同一批 顶尖 模型在BrowseComp上眼下能拿到约90%的分数。差距之大,直观说明LoHoSearch把搜索智能体真正的短板暴露了出来。更有意思的是上下文策略的边际效用:在LoHoSearch上, 最好 的上下文策略只带来6.8个百分点的提升,而同样的操作在BrowseComp上能换回14个百分点——这意味着靠提示和上下文工程去补能力的老办法,在这套新基准里几乎失灵。 这套基准本身有544道问题,覆盖11个领域,问题采用树状与图结构组织,且已经开源。当老基准被刷到顶、搜索agent的真正挑战才刚开始,LoHoSearch很可能成为下一个绕不开的必测项。
灵剪短视频生成工具发布,通过分步审批和本地控制台打破黑箱生成模式
灵剪在脚本、配音、画面渲染前设置三道人工审批,数据与密钥均不出本地,支持火山方舟Seedance文生视频;项目提供四套样片,并明确表示不保证爆款,只保证流程可复跑、可审计。
杨植麟在GTC2026 摊牌:月之暗面把Adam、全注意力和残差连接全换了,而且全部开源
大模型训练的地基,正在被一家中国公司悄悄撬动。在GTC2026的演讲How We Scaled Kimi K2.5中,月之暗面CEO杨植麟没有只讲K2.5这一个产品,而是把过去一年多公司想清楚的一件事摊开了:当开源模型要逼近闭源前沿,除了继续堆参数和算力,还有另一条路——把Transformer时代沿用了近十年的三个基础组件,各自重新做一遍。优化器Adam(2014年提出)、注意力机制(2017年)、残差连接(2015年),月之暗面给这三个地基组件各递上了一个替代方案,而且全部开源。 杨植麟把整条技术路线拆成三个方向:让每个Token更值钱、让更长的上下文真正有用、让多个Agent同时协作。除此之外,他还抛出了两个重要进展:视觉训练如何反哺文本能力,以及月之暗面刚公布的下一代架构Attention Residue。 先说最现实的一道墙:高质量数据快不够用了。互联网上有价值的文本本就有限,模型越做越大、要的数据越来越多,大家迟早撞上数据墙。既然数据很难翻倍,月之暗面的思路是让模型从同样的数据里学到更多,给出的答案是MuonClip,用来替代已经用了十多年的Adam优化器。它基于Muon优化器,在更新参数时尽量让不同方向的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。实验结果是:用同样数量的数据,MuonClip的训练效果接近把数据量增加一倍,既压低了训练成本,也推高了模型能力上限。杨植麟打了个比方:手里若有50万亿个高质量Token,效率提高一倍,就等于又多出50万亿Token,在优质数据越来越稀缺的当下,这种效率提升比单纯加算力更关键。 不过Muon有个麻烦:模型扩展到万亿参数后,注意力层里的数值容易失控, 最大 logit会突然飙升到1000以上,而正常范围通常只有50到100,数值继续膨胀训练曲线就会发散、整个训练可能直接崩掉。月之暗面为此设计了QK-Clip,在模型前向计算时实时检查每个注意力头的 最大 logit,一旦超过安全范围就同步缩放Q和K的投影把数值压回来,它不改变收敛效果,只负责维持数值稳定。靠着QK-Clip,Muon被成功扩展到万亿参数规模,训练了超过15万亿Token,整个过程没出现过一次loss spike。 第二个方向是让长上下文真正发挥作用。杨植麟引用了Scaling Law论文作者Jared Kaplan等人的实验:LSTM读到一定长度后效果就难再提升,而Transformer上下文越长、预测通常越准,且难见明显饱和点。这个特性在Agent时代尤为要紧——复杂任务可能持续几天甚至几周,模型得记住之前做了什么、得到过哪些结果、哪些方向已经失败,长上下文若不能持续提供有效信息,任务链条很容易断掉。麻烦在于标准全注意力的计算量随上下文长度平方增长,扩大十倍计算量可能增加一百倍,到百万Token级别训练和推理成本都高得吓人。月之暗面的解法是Kimi Linear,核心是名为KDA(Kimi Delta Attention)的线性注意力机制,它让模型学会哪些信息长期保留、哪些快速忘掉。传统线性注意力只有一个全局衰减系数,像所有内容共用同一个遗忘按钮;KDA把一个衰减系数拆成多个,不同信息通道可用不同遗忘速度,慢衰减的通道保留长距离信息,快衰减的通道及时腾出空间吸收新内容。实际使用中,Kimi Linear按3比1的比例把线性注意力层和全注意力层混合,杨植麟称这是 第一 个在短上下文、长输入和长输出任务上都能全面超过全注意力的架构,上下文扩展到百万Token甚至更长时,效率优势更明显。 第三个方向是从一个Agent变成一支Agent团队,月之暗面称之为Agent Swarm。它的组织方式像一家公司:一个主Agent充当CEO,负责理解目标、拆解任务并分配给多个子Agent,子Agent可以分别扮演研究员、程序员、数据分析师和事实核查员,完成后由主Agent汇总。 最大 价值是把串行任务改成并行,过去一个Agent要依次搜索、阅读、分析、编码、核查,现在几十甚至几百个Agent可以同时开工。训练这种协作并不容易,月之暗面设计了三种奖励:实例化奖励鼓励主Agent创建更多可并行子任务、避免退化回串行;完成奖励要求子任务真正做完、防止为刷奖励批量开空任务;最终结果奖励判断任务是否真正解决。三种奖励的权重随训练动态变化,前期重任务拆解与并行化,后期转向最终结果。从演示看,Agent Swarm能同时下载阅读几百个信息源完成研究、并行撰写上百页文献综述的不同章节、同时分析十个数据集。Kimi K2.5发布时它已支持最多100个Agent并行、任务最多执行1500个步骤,而今年4月发布的K2.6把并行上限提高到了300个。 一个意外收获出现在视觉与文本的融合上。K2.5与前代K2的关键区别是改用早期融合训练:过去很多开源多模态模型走后期融合,先用约20万亿文本Token训出语言模型,再用约2万亿多模态Token把视觉能力贴上去;K2.5则从训练一开始就把视觉和文本数据混在一起,在K2文本基座上又训练了约15万亿混合Token。这带来了两个让杨植麟兴奋的结果。其一是只训练视觉任务也能提升文本推理:研究团队只让模型数数、识图、做视觉问答,没加数学或编程训练,文本推理能力却也变强了,换言之模型在练看的同时,想的能力也提升了。其二是反向的,如果文本基座足够强,模型甚至不一定需要专门的视觉SFT数据——K2.5采用零视觉SFT方案,所有监督微调数据都是纯文本,再通过文本与视觉联合的强化学习获得视觉能力,最终在视觉任务上仍接近 最先 进水平。杨植麟认为,这种双向迁移来自早期融合:当文本和视觉进入同一表征空间,一种模态学到的能力才有机会迁移到另一种,这也是K2.5能看图写代码的根基。 演讲末尾,杨植麟介绍了月之暗面刚发布的新研究Attention Residue(注意力残差),论文发表于3月15日,距离演讲仅两天。残差连接是2015年由何恺明等人提出的深度网络基础技术,如今是Transformer的标准组件,它让每一层既处理上层结果、又保留一条直接传递信息的通道,使深层模型能稳定训练。杨植麟援引Ilya Sutskever的说法,把残差连接理解为旋转了90度的LSTM——LSTM在时间维度上传信息,残差连接在深度维度上传信息。既然Transformer已经用注意力替代了LSTM在时间维度上的循环,那么深度维度是否也能同样替换?Attention Residue就是这个思路的产物:标准残差主要用上一层输出,而它允许当前层查看所有前序层输出,再通过注意力决定哪些历史信息保留、哪些忽略,让模型从被动接收上层结果,变成主动从整个计算历史中挑选信息。为控成本,实际采用分块版Block Attention Residual,每16层组成一个块,块内仍是标准残差,块间才用注意力残差,实验显示约8个块就能拿到大部分收益。它带来了约24%的Token效率提升,按杨植麟的算法,50万亿Token效率提高24%等于额外增加12万亿Token,在GPQA、MATH、HumanEval等推理、数学与编程测试上提升尤其明显。 把三件套摆在一起看,月之暗面的替代清单清晰得近乎挑衅:Adam换成MuonClip、全注意力换成Kimi Linear、残差连接换成Attention Residue,分别对应怎么从有限数据学更多、怎么更高效用超长上下文、怎么让深层网络更灵活传信息。三者都能相对独立地替换现有组件,且都已开源。这些技术能否直接叠加、增益能否简单相乘,目前还没经过完整验证,但它们至少说明了一件事:很多被认为已经足够好的基础组件,可能远没有到达终点。在优质数据越来越少、训练成本越来越高的当下,重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。这也正是杨植麟整场演讲想表达的核心——开源模型不能只是开放,还必须足够强。
嫌whisper.cpp和ONNX不够用?Handy作者开源transcribe.cpp:60+转录模型、GPU加速、即插即用替代
本地语音转录这块,开发者长期被困在一个尴尬的夹缝里:要么用whisper.cpp,要么用ONNX,想上苹果设备还得再塞一个MLX,等于同时维护两套引擎、为每个引擎各移植一遍模型。7月19日,知名语音转文字应用Handy的作者和维护者sebjones,把他在分发跨平台应用时踩过的坑,直接炼成了一个新库transcribe.cpp,并发布v0.1.0版本。这是一个基于ggml的语音转录库,支持当下所有 最新 的转录模型,且handy-computer这个Hugging Face组织下发布的每一个模型,都经过了数值验证和词错率(WER)测试,确保与官方参考实现一致。作者也坦承,这是0.1.0版本,难免有他一个人发现不了的粗糙之处,欢迎社区报告一起修。 催生transcribe.cpp的,是一连串憋屈的现实。sebjones直言,用现有的ASR推理栈去分发跨平台应用,体验非常糟糕。市面上虽有一些零散库声称支持大量模型,但作者不明、测试不清,留给他的是一连串疑问:这个库什么时候会停更?作者有没有考虑过官方绑定,让你能在真正的桌面或移动应用里用?它本质上是不是只是演示代码?做过基准测试吗?比ONNX快吗?作为一个需要把语音功能塞进Handy的人,他想要的是一个能下载模型文件就直接跑推理、且推理结果能和参考实现对得上的库;推理要跑在GPU上拿 最佳 性能,要能轻松嵌进Handy,而不是背上一个庞大的PyTorch;必须同时兼容Mac、Windows和Linux。几经比较,ggml成了他眼中 最好 的前进方向,既有强大社区,分发能力也出色。 落到具体能力上,transcribe.cpp给开发者交付的是一个又快又准的推理引擎,外加极其广泛的模型覆盖。它支持16个ASR模型族、合计60多个模型,更多模型还在路上。加速方面,它通过Vulkan、Metal、CUDA和TinyBLAS四条路径把推理搬到GPU上,作者尤其把Vulkan当成任何本地推理应用的底线,并为每个支持的模型在Fedora系统的Ryzen4750U(CPU加Vulkan)以及自己的M4Max上做了基准测试。每个模型都经过数值验证与完整的WER扫描,意味着它们被数千条语音片段反复打磨,输出与参考实现非常接近甚至完全一致,这些验证结果同时公开在transcribe.cpp仓库和Hugging Face对应模型页面里。功能层面,它支持流式转录与批量转录,并且基本可以作为whisper.cpp的即插即用替代方案——Handy原本就跑在whisper.cpp上,作者正是要用transcribe.cpp发一个更新把它换掉,为此他特意保持了对whisper.cpp随Handy发布的流行.bin文件的兼容,transcribe.cpp能直接运行这些文件;虽然部分标志和功能尚未对齐,但绝大多数用例下其whisper实现足够可靠,性能也大致相当。 真正让这个库有望走进真实产品的,是它从 第一 天起就把语言绑定当成了重点。库本身用C/C++写成,作者不仅需要Rust绑定,也清楚要让本地语音转录被广泛分发,至少得有像样的官方绑定撑场面。他挑了四种覆盖度最具代表性的语言:Python、JavaScript与TypeScript、Rust,以及Objective-C与Swift。他也欢迎社区在愿意承担维护的前提下贡献更多绑定。这些决策很大程度上由Handy的诉求驱动,而Handy本身的高人气,也让作者有了持续维护这个库的动力。 在作者看来,transcribe.cpp的 终极 目标是让本地ASR变得更易用。语音转录在绝大多数设备上都能跑出 极高 准确率,根本没必要把声音传到云端。他举了一个硬核例子:RK3566这块性能羸弱的芯片,用transcribe.cpp在CPU上就能以快于实时的速度跑模型,而用上 最先 进模型做快于实时的转录,功耗也只有几瓦。他判断,未来出于各种原因,会有更多推理发生在本地,分发问题因此变得至关重要;transcribe.cpp虽然远没从整体上解决它,但希望是向前的一小步。 在致谢里,作者点名了多位助力者:Mozilla AI及其BiR项目与工程师Davide在该项目还只是个模糊念头时就决定支持他;ggml及其贡献者是整个项目的地基;Modal提供了用于WER测试和CUDA验证的算力积分;Blacksmith扛起了部分CI/CD;Hugging Face则既是本地AI社区的支柱,也为handy-computer组织提供了模型存放的私有空间。至于是否有AI辅助开发,作者回答得很干脆:当然有,一个人靠ggml在几个月内从零写出这种规模的引擎是不可能的,但眼前这些文字没有一行是AI写的,全部出自他自己的口和手。 原文链接:workshop.cjpais.com/projects/transcribe-cpp
昆仑万维把 2026 定为世界模型元年:Matrix-Game 3. 5 单卡实时生成,5B模型跑出20FPS
世界模型这条赛道,今年被一家中国公司正式写进了自己的时间表。在2026世界人工智能大会(WAIC)上,昆仑万维董事长方汉宣布,2026年就是世界模型元年,并一口气发布了Matrix-Game3.5世界模型、Mureka v9.5与O3音乐模型三款新品。 最受关注的是Matrix-Game3.5。昆仑万维给这套世界模型塞进了Patch级记忆注入能力,让模型在生成过程中能够携带并调用画面片段的记忆,从而把交互推向实时。性能数字相当亮眼:一个5B参数的模型,在720p分辨率下,单张显卡就能跑到20FPS的实时生成速度。更关键的是,其核心架构已经开源,这意味着做游戏和具身智能的开发者,可以直接把它拉下来试手。 音乐侧的两款模型则把AI创作做成了更明确的工具形态。Mureka v9.5与O3把AI音乐推向版本化创作,用户可以在不同版本之间迭代、比较和取舍,工具感比以往的生成式玩法强出不少。 从世界模型的实时交互,到音乐创作的版本化管理,昆仑万维这次的发布提纲,是把2026年定义为一个模型开始真正理解并生成可交互世界的起点。 开源地址:
Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破
Google DeepMind近日发布新模型GenCeption,该模型基于预训练视频生成模型构建,用于解决深度估计、图像分割、3D姿态估计等经典计算机视觉任务,并在多项基准测试中达到接近或超过当前领先水平。值得关注的是,GenCeption所需训练数据规模远低于传统专用视觉模型。 当前计算机视觉领域仍以任务专用模型为主,例如用于分割任务的Segment Anything、用于深度估计的Depth Anything等,不同任务通常采用独立架构。DeepMind研究团队认为,大型文本到视频模型在训练过程中学习了场景空间结构、物体运动规律以及语言与视觉之间的关联,可能具备成为通用视觉基础模型的潜力。 GenCeption基于阿里巴巴开源视频模型Wan2.1开发,通过简化架构实现一次前向传播即可完成视觉任务预测。模型能够根据文本提示,从同一段视频中生成深度图、表面法线、分割掩码以及姿态估计结果,并通过可训练模块支持3D关键点等非图像输出任务。 在训练数据方面,GenCeption主要使用包含7500个视频的合成数据集,由800个人体模型结合200组动作序列,并通过Blender渲染生成。研究显示,该模型在深度估计、表面法线预测、3D姿态识别以及语言引导分割等任务中均取得优异表现,训练数据量仅为部分现有模型的七分之一至五百分之一。 此外,GenCeption展现出较强泛化能力。尽管训练数据主要来自单人合成人体视频,但模型能够处理真实世界中的多人场景、动物以及人形机器人等未见类别,并生成包含细节的视觉预测结果。 不过,研究团队也指出,联合训练多个任务可能影响部分复杂任务性能,同时模型推理速度仍需优化。目前,大模型处理81帧视频约需6至10秒。 GenCeption的发布表明,视频生成模型正在从内容生成工具向视觉理解基础模型方向拓展。未来,如何让生成式模型获得更可靠的物理理解和现实反馈能力,仍是AI研究领域的重要挑战。
面壁智能开源MiniCPM-Robot:1.5B的VLA模型完整放出,个人开发者也能在真机器人上跑操作
具身智能这场仗,过去基本是巨头和实验室的专属游戏——模型太大、门槛太高,普通开发者连真实机器人都摸不着。7月19日,面壁智能(OpenBMB)把这扇门直接踹开了。它开源了首个具身AI模型系列MiniCPM-Robot,把1.5B参数的视觉-语言-动作模型完整放出,让个人开发者也能在真实机器人上跑操作与目标跟踪,这种开放程度在具身领域相当罕见。 这套系列包含三个核心组件。主角之一是MiniCPM-RobotManip,一个1.5B参数的通用视觉-语言-动作(VLA)模型,专门负责机器人操作。另一位是MiniCPM-RobotTrack,一个面向现实世界目标跟踪的紧凑型模型。两者之外,面壁还一并发布了高性能推理框架PhyAI,专为具身模型构建,目标很直白:让机器人真正具备理解、记忆与行动的能力。三者合力,把高效、实用且开放的具身智能,从论文和演示一步步推向现实世界的机器人。 对开发者而言,最实在的是伸手就能拿到。模型权重与代码已托管在GitHub仓库github.com/OpenBMB/MiniCPM-Robot,MiniCPM-RobotManip与MiniCPM-RobotTrack各自的权重也分别在Hugging Face开放下载。做机器人的人,现在可以clone下来直接跑。 当1.5B的VLA模型不再被锁在实验室里,具身智能的下沉速度,或许会超出很多人的预期。 项目地址:
神珍科学多模态基础模型在沪亮相: 110 亿参数打通六类科学数据,一个模型读懂DNA到气象场
7 月 19 日,上海科学智能研究院在 2026 世界人工智能大会的科学智能开放论坛上,揭开了一个承托多领域科学智能研究的底层 超级 大脑——神珍科学多模态基础模型。这个名字取自《西游记》里的天河定底神珍铁,团队希望这套开放模型以相对精炼的形态承载多样科学任务,也让更多研究者参与检验、使用与共建。它是今年 3 月初面世的系统级科研智能体大圣的 超级 大脑。 在技术上,神珍立足物质科学、生命科学、地球科学等多元学科场景,阶段性实现了跨领域科学知识的统一表征与多模态融合理解。模型总参数约 110 亿,面向DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,在一个统一模型中同时支持科学理解与多类结果生成。它的共享主干选用Qwen3-VL-8B,并为六类科学数据各设专门的数据处理通路,在接入共享模型之前分别保留序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节。更实用的是,神珍能直接生成RNA序列、可供计算机读取的分子表示SMILES、全球气象场以及医学影像分割结果,相当于把理解与生成两套能力捏进同一个框架。 开源与开放是这套模型的关键姿态。上智院已经放出了模型权重、推理代码、示例脚本与使用文档,研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台上汇聚的 1500 余个科学模型和工具组合使用;也可以在Hugging Face下载权重、在GitHub获取代码,一同共建开放的科学智能社区。 这场发布发生在WAIC2026 科学智能开放论坛的舞台上。论坛由世界人工智能大会组委会办公室指导、复旦大学和上智院联合主办,聚焦AI原生时代的科学闭环发现,汇聚了诸多知名科学家与一线青年产学研代表,深度探讨人工智能如何从方法论底层重构科学发现的全流程,谋一个开放协同的科学智能新生态。四位重量级科学家发表了主旨演讲,从不同维度打开理解科学智能的视角。 诺贝尔化学奖得主、香港中文大学深圳教授阿里耶·瓦谢尔强调,AI必须建立在可靠的物理机制之上。图灵奖得主、蒙特利尔大学教授吉勒斯·布拉萨德对量子计算在新材料发现等领域的潜力寄予厚望,并建议青年研究人员追随兴趣而非业界时髦,因为当下的研究发现有可能在十年之后才真正落地应用。 之江实验室主任、中国工程院院士王坚的分享围绕科学基础模型与科学作为一个整体展开。他指出,科学智能不在论文文本而在数据,但今天的基础模型仍建立在文本之上,未来需要让科学数据成为科学智能的原住民,也就是把各学科数据词元化,纳入同一表征空间。他判断AI正变得像数学一样基础,科研范式也将从STEM走向STE+MAP,即数学、AI与公共设施的结合,让科学重新成为一个整体。 美国国家科学院院士、普林斯顿大学教授范剑青以智能科学和社会为题,把AI概括为统计学习与优化决策的动态循环,并用社会经济测度、金融风控和大模型应用举例,阐释AI如何将数据转化为社会洞察。他强调AI服务于经济社会发展,在推动智能体与科研创新的同时,也必须持续回应就业结构变化、教育转型、伦理安全以及人类能否保持有效控制等问题。 巅峰 对话环节,与会嘉宾达成共识:AI原生时代的原始创新,一大关键在于人、数据、模型、实验与学术判断能否形成崭新的协同发现机制,这既需要科研基础设施的系统性升级,更需要一代科研工作者思维方式和能力结构的根本性重塑。 复旦大学特聘教授、上智院院长漆远点出了这场变革的终局想象。他表示,AI要从预测下一个Token走向发现未知的规律,而AI发现未知科学规律将是 超级 智能的开始。这一进程的核心,在于通过压缩从高维空间运用和发现简洁的机理,以及科学验证的高效闭环,这将促进数字与物理世界的结合与新的模型架构产生。他提醒,真实的科研是包含文献、假设、数据、模型、仿真、实验及反馈的长链条过程,科学智能领域正在着力发展能够组织复杂研究流程的系统能力。 当 110 亿参数的神珍把六类科学数据收进同一个大脑,科学发现的形态,或许正被悄悄改写。
阿里新一代大模型千问3. 8 将至:预览版抢先登陆阿里云与Qoder,正式版拟近期开源
大模型的开源节奏,正在被国内头部厂商越拉越紧。 据悉,阿里 最新 一代大模型千问3. 8 即将发布并同步开源,这意味着通义千问家族在开源赛道上又向前迈出一步。 新模型的体验窗口已经悄然打开。目前,Qwen3.8-Max预览版已率先上线阿里云Token Plan、Qoder以及QoderWork三个平台,用户现在就能提前摸一摸这一代新模型的能力边界。按照阿里的规划,Qwen3.8-Max的正式版将于近期正式推出并开源,届时完整的模型权重将向开发者开放。 在国产大模型密集发力的当下,阿里选择让预览版先行、正式版紧随开源,既提前释放了产品信号,也把模型能力放进真实用户场景里接受检验。千问3. 8 正式版开源的那一刻,开源大模型阵营的 天花板,大概率又要被重新丈量一次。
不会代码也能做产品,这是一份从0开始的Vibe Coding保姆级教程。
原创 数字生命卡兹克 2026-07-20 08:08 北京 Agent就是我们最好的老师 最近,国产大模型也都起飞了。 基本都达到了半步Fable 5境界。 2.8T的Kimi K3,2.4T的Qwen 3.8 Max,而在未来,肉眼可见的,还有马上上线的DeepSeek V4正式版,还有Seed、GLM、MiMo、LongCat等等要到来的更大规模的版本。 我觉得,这就是所有在国内,想用AI搓一个自己的产品、所有想把自己想法变成现实的人,最好的黄金岁月。 现在,你不需要捏着鼻子用海外的模型了,考虑到对面封号、考虑到魔法、考虑付费等等,你可以直起身来,用我们自己的模型,来做你自己想做的东西。 包括我自己搓的产品AIHOT,从5月发布开始,到今天,2个多月的时间,最近一周的周活终于过了30万,月活也正式过了60万。 所以,我觉得今天,我也可以分享一下,作为一个纯外行,如果你想从0开始,用国产模型,徒手搓出一个完全属于自己的产品,应该需要哪些步骤和流程,还有一些乱七八糟的坑。 先叠甲一下,下面这套流程,是我自己作为非专业者,目前跑得比较舒服的一条路径,主要面向完全不懂代码、想先把第一个产品做出来的人。不同类型的产品,可以选择不同的托管平台,工程团队也会有不同的开发规范。 这里讲的是一条足够简单、能够从零走到正式上线的方案,完全不代表唯一的标准答案。 那,让我们开始吧。 1. 买一个国产大模型的Coding Plan套餐。 你需要一个能帮你写代码的AI。 Kimi、GLM、Qwen等等都无所谓,能买到哪个就用哪个,差距没有你想象的大。 2. 去下载各家官方的Agent编程产品。 买了Coding Plan之后,去下载各家官方的Agent编程产品。 ZCode、Qoder、Kimi Code等等,你买了哪家的Coding Plan就用哪家的,因为未来肯定是自家的Agent更适合自家的大模型,可以提前用了。虽然现在很多的Harness还是不如Claude Code,但是我觉得会很快的补上。 3. 想好你的产品名字。 很多人觉得名字随便起一个就行了,做完再改。 但不是这样的,你后面所有的东西,logo、域名、备案、小程序名称、App Store上架,全都跟名字绑定,改名的成本比你想象的大一百倍。 名字简短、好记、最好有一点辨识度,起名的时候顺便在微信搜一下公众号、小程序有没有同名的,在App Store和各大应用商店搜一下有没有撞车的。 这一步花十分钟,能省你后面很多麻烦。 4. 注册一个域名。 名字想好的那一刻,立刻去注册域名。 去火山引擎、腾讯云、阿里云啥的都可以,去域名注册页面,搜你想要的域名。 我自己就是在这一步吃了亏,AIHOT当时真的就是随便取的,然后后面没想到这玩意做起来了,结果一查,AIHOT.com这个域名,是我可能永远都买不起的程度。。。 5. 买一台服务器。 你的产品做出来之后,它得有一个地方运行,不能跑在你自己电脑上,你电脑一关,全世界都访问不了了。 为了让整套教程拥有一条统一、直观的路径,所以我们下面都以以云服务器为例,部分静态网站和轻量产品也可以使用Serverless、云开发或托管平台啥的,不一定需要自己维护服务器。 不过现在维护服务器因为有了Agent之后,维护已经很简单了。 买服务器这里,推荐一下腾讯云上的服务器,新客一般都有大优惠,一年一个轻量的可能才99或者199,轻度产品使用足够了,不知道配置怎么选,就直接截图问你的AI,告诉它你想做什么产品,让它帮你挑。 当然,最好的方式,就是让Agent操控你的浏览器,直接帮你选。 6. 同步去做ICP备案。 这一步非常重要。 在中国大陆,你的域名如果要对外提供服务,必须做ICP备案。不备案,域名解析直接被运营商拦截,用户打不开你的网站。 在你买服务器的那个云平台上找到“备案”入口,按指引提交身份证、域名信息、网站名称,然后等审核,一般一到两周。 一定要跟开发同步进行,别等产品做完了才想起来备案。 如果你做的是出海产品,那就无所谓了,但出海的话记得买海外服务器,比如新加坡或者美西的节点,离你的目标用户近一些。 7. 新建一个你的项目文件夹。 OK,准备工作全部做完了。域名有了,服务器有了,备案提交了,AI编程工具也装好了。 现在,在你的电脑上新建一个文件夹。 就这样。起一个跟你产品名字一样的文件夹名,放在你喜欢的位置。 这个文件夹,就是你接下来整个产品的家,你的所有代码、所有配置、所有文档,都会在这个文件夹里。 8. 在这个项目文件夹下,启动你的Agent,开始开发。 打开你第2步装好的Agent编程产品,把工作目录指向你刚才建的那个文件夹。 具体怎么操作,每个产品不太一样,但大致都是"选择一个工作目录"然后开始对话。 从这一刻开始,你的AI就驻扎在你的项目里了,它能看到你的文件,能帮你创建新文件,能帮你写代码、跑代码、调代码。 9. 注册一个GitHub账号。 GitHub是全球最大的代码托管平台。 你的代码不能只存在你自己电脑上,万一硬盘坏了、电脑丢了,你什么都没了。 所以,可以注册一个GitHub账号(免费的),让Agent帮你连接上你的GitHub账号,然后把你的代码推到GitHub上的一个私有仓库里,注意是私有仓库,不是公开的。 整体告诉你的Agent一句话就行了。 “初始化Git仓库,连接我的GitHub账号,创建一个私有GitHub仓库,并提交第一个初始版本。” 现在,你和Agent你们两两个的协作,正式开始。 10. 开启Plan模式,说清楚你要做什么。 大多数Agent编程产品都有一个Plan模式(或者叫规划模式),用人话告诉AI你想做什么,它会先帮你理清楚需要做哪些事情,列出一个计划清单,别直接开始执行。 你在这一步要做的事情就是,用最简单直白的语言,描述你的产品。 注意,不要想太多,你不需要画原型图,不需要写需求文档,不需要列所有功能,就说你最核心想要的那个东西,后面的功能可以慢慢加,但第一版可以比较简单。 先看到那个产品出来的正反馈,比什么都要强。 AI会根据你的描述生成一份规划文档,你看一下是不是你想要的方向,确认了就进入下一步。 11. 让Agent根据Plan文档,开始执行开发。 确认了Plan之后,告诉Agent开始执行。 它会自动创建项目结构、写代码、装依赖等等,你什么都不用管,看着它干活就行,过程中,它做完一块会问你要不要看看效果,或者有没
transcribe.cpp
面向 16+ 模型家族的 ggml 语音转文本推理
open-seo
Semrush 和 Ahrefs 的开源替代品
topcoat
一个开箱即用的 Web 应用构建框架
OmniRoute
永不停歇地编码。免费 MIT 许可的 AI 网关:一个端点,268+ 提供商(50+ 免费),500+ 模型——Claude、GPT、Gemini、Kimi K3、GLM、DeepSeek。兼容 Claude Code、Codex、Cursor、Cline 和 Copilot。配额感知自动回退,RTK+Caveman 压缩可节省 15-95% tokens,支持 MCP/A2A、多模态、桌面/PWA。由 500+ 贡献者打造。
moonshine
极低延迟的语音转文本、意图识别和文本转语音,用于构建语音智能体和界面
openship
自托管部署平台
iptv
来自世界各地的公开可用 IPTV 频道合集
ai-agent-book
《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码
Ontology-Playground
免费、开源的 Web 应用,用于学习本体和 Microsoft Fabric IQ。浏览预构建本体目录,可视化设计自己的本体,导出为 RDF/XML,并分享交互式图表。零后端,完全静态。
cognee
Cognee 是面向智能体的开源 AI 记忆平台。通过自托管的知识图谱引擎,为您的 AI 智能体提供跨会话的持久长期记忆。
agency-agents
触手可及的完整 AI 代理机构——从前端魔法师到 Reddit 社区忍者,从奇思妙想注入者到现实审查员。每个智能体都是具有个性、流程和经过验证的交付物的专业专家。
fastmcp
🚀 快速、Pythonic 的 MCP 服务器和客户端构建方式。
RynnBrain 1.1:迈向更强大且具泛化能力的具身基础模型
We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.
Man, it's baffling to me that people either forget too quickly about the
Man, it's baffling to me that people either forget too quickly about the impact of open source or are just too lazy to pick up a book and read about it. Having worked on open-source tools all these years, it's really sad to see such ignorance. Thanks for reminding people, Yann. Yann LeCun: @hosseeb @deanwball Soooo, releasing Linux was dumping? Apache, MySQL, PHP? HTTP, TCP/IP, OpenSSL, OpenSSH? Libjpeg, VLC? The open source software stack of the mobile communication network? Signal? PyTorch? Llama?
Open source and competition are such beautiful things. Why would anyone
Open source and competition are such beautiful things. Why would anyone want to kill those things? The answer is clear. Let's continue to accelerate open source AI. We win when this happens. Guillermo Rauch: Based on internal evals: ▪️ Kimi K3 is top-tier at cybersecurity There is chatter on X that Moonshot benchmark-overfit. These are stealth evals. Model has raw IQ. ▪️ Sol is a leap ahead in cyber capability At a significantly higher cost, but quite remarkable still. ▪️ Fable
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qw
RT meng shao DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂
我不认同,这是典型的唯参数论。
RT WeZZard 我不认同,这是典型的唯参数论。忽略了模型厂商的战略眼光、模型训练对用户体验的供给以及模型使用人口变迁。 Kimi K3 标注是 Opus 4.8 级别,我个人体验下来其实是基于它的木桶短板标的,而它的长板完全可及 Fable 5。Kimi K3 在长尾数据的训练上面并没有 Fable 5 训练得那么全,会导致在多轮对话的任务中失败一次,然后次次修补,进入一个很差的体验。这和 Opus 4.8 的体验完全一致。 而 2026 年中的顶规模型可以保证状态一直在线。首先 Fable 5 的长尾数据训练非常全面。然后 Fable 5 的急剧性能衰减需要到达上下文长度的 80% 到 90% 才会出现。而 Kimi K3 基本在 40-50% 时就能感受到性能衰减。 上述 Fable 5 的优势对于整体体验来说提升的不只是一点两点,而是四五倍的提升——因为每一步有 5% 的任务失败概率,那么 10 步都成功的概率仅为 60%;而把每一步的失败概率消除一半,那么 10 步都成功的概率将提升至 78%。这个提升对于长程任务来说只会更夸张,比如放大到 50 步则可以将成功率提升接近 4 倍。 这就是 Fable 5 对于从事从 0 到 1 创新的工作者来说体验非常棒的原因——因为从 0 到 1 不可能 one-shot、也极有可能进入数据训练盲区。 那为什么大家会觉得 Kimi K3 好?是因为它的 one-shot 能力真的很强。而 one shot 成功自然会带来成就感。 而早在移动互联网开始时,很多人争相阅读的 Emotional Design 中就强调过「成就感」对用户体验带来的提升。Frog Design 的创始人 Hartmut Esslinger 也提出过 "Forms follow emotion(形式追随情绪)" 的设计原则。 所谓「形式追随情绪」就是让情绪成为恰到好处的功能装置。而大部分用户想用最快的速度搞点东西出来,那极高的 one shot 成功率带来的极高情绪满足就是最好的功能装置。 但 one shot 很多 AI IDE 在 2025 年就能做到,为什么 2025 年它的传播效应没有这么高,而 2026 年可以? 这是因为用户人群发生了改变。在 2025 年的主要适用人群——专业开发者看来,one-shot 能力是非常鸡肋的,因为我们要对工程细节进行打磨。但是 2026 年更多非程序员群体以办公人群的身份加入,导致评价标准发生了变化。 就像在移动互联网时代我们不能说:对于普通人来说想处理照片 Lightroom 足够了,没有必要购入 Photoshop。因为对于普通人来说真正合适的是美图秀秀、醒图、各种风格化相机。 可以说月之暗面在模型训练方面押注前端 one-shot 能力确实是一手好棋。 当然,这些用户会成长,会想做一些个性化的改动、会有创造新东西的需求。最后还是会碰到长 K3 上下文性能衰减和长尾数据不全面的短板。不过我想国产开源大模型应该已经有了第一批国内原住民——这些人没有用过美国头部两家的模型,在他们眼里,Kimi 就是最好的。 Fenng: 其实大多数用户,对他们那点简单的需求而言,给他们一个中等水平的模型已经足够用了,也就是市场上随便哪个几乎都足够用。如果你宣传某个模型有十万亿参数,评测绝对第一,超级无敌。那他们用起来之后,就会真心觉得这模型真的超级超级厉害,用起来心情愉快,还会不停发文狂吹乱夸。 这就是 𝕏 上 AI
@hosseeb @deanwball Soooo, releasing Linux was dumping? Apache
RT Yann LeCun Re @hosseeb @deanwball Soooo, releasing Linux was dumping? Apache, MySQL, PHP? HTTP, TCP/IP, OpenSSL, OpenSSH? Libjpeg, VLC? The open source software stack of the mobile communication network? Signal? PyTorch? Llama?
逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……
关注前沿科技 2026-07-19 18:18 北京 小机器人开始在物理世界狠刷「经验值」 梦瑶 发自 凹非寺 量子位 | 公众号 QbitAI 太!火!爆!了! 还得是WAIC,还得是AI圈春晚—— 哪怕到了展会第三天,依旧人挤人人人人,火爆热程度堪比上海这两天的天气。 (doge) 甚至,据说,连黄牛票…都炒到3000块钱一张了!? 真不怪大家这么热情,主要吧,还是展会现场太有看头了—— 这边机器人模拟药房 拿药取药 、那 边 机器人组团开 演奏会,还有各种长进真实硬件里的Agent和操作系统。 具身智能、世界模型、AI Coding、Token经济、AI硬件 ……过去一年最火的技术概念,今年几乎全都被搬到了现场。 如果说去年逛展大家聊得更多的,还是AI还能做点啥,那到了今年,一个非常非常非常明显的变化是—— AI已经从屏幕里走了出来,开始往工厂、家庭、药房、穿戴设备和各种真实生产场景里「疯狂流动」了: 在一众展商中,我也看到了一个咱非常之熟悉的玩家: 京东。 只不过吧,这次,这家厂商亮相的方式确实有亿点不一样。 此前,京东就官宣要打造 全球最大的物理世界运营中心,没想到这么快就把最新成果搬到了WAIC现场—— 首次集体亮相的JoyAI全系列大模型、具身数据采集与训练链路,还有以JoyInside为底座打造的京东AI Home,全都来了: 逛完今年的WAIC,我们会发现AI的能力边界,真的开始从数字内容的理解与生成,进一步延伸至物理世界的环境感知、实时决策与具体执行。 而过去停留在屏幕里的智能概念,如今已经开始进入工厂、家庭和各类终端设备,真正参与现实世界的现实运行了。 看得见、听得懂、还能执行,面向物理AI的模型全家桶来了 这两年,大模型已经进入密集发布期。 今年走进WAIC主场馆,我们会发现图像、视频、语音、交互、具身等不同方向的模型几乎覆盖了所有热门赛道。 但不得不承认的一点是,在真实的物理环境中,单一模型给出判断,只是整个AI任务执行流程的「起点」。 后续的路径规划、设备控制、动作执行与结果反馈,可以说每个环节都直接影响一个任务能否真正形成完整闭环!! 也正因如此, 物理AI对模型能力的要求,也从单项能力的突破进一步延伸至感知、理解、决策、执行的系统协作。 △ AI生成 就在今年WAIC现场,京东直接端上了一整套面向物理世界的JoyAI模型「全家桶」。 从语音、图像、视频、实时交互、到具身智能,可以说是把物理AI需要的模型能力统统梭哈了…… 对物理AI来说, 视觉能力 决定了AI能否建立对现实环境的连续认知。 毕竟一台机器人真正开始行动前,需要先弄清周围有什么、物体位于哪里,以及彼此之间存在怎样的空间关系。 而京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,刚好对应了 视觉能力 向物理世界延伸的不同维度—— JoyAI-Image-Edit 实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素进一步走向理解空间结构。 △ JoyAI-Image-Edit JoyAI-Echo 通过跨模态记忆维持长视频的一致性, JoyAI-VL-Interaction 则把理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边交互、调用Agent。 值得一提的是,京东还在今年WAIC上,展示了多模态领域的最新研究成果:实时视频编辑模型 JoyAI-Video-Edit。 具体来说,用户可以自定义画面,并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。 从长时一致性、实时理解到即时修改,几款模型分别补上了动态视觉中的不同环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。 △ JoyAI-Video-Edit 视觉模型让设备看懂周围环境,但当设备真正进入家庭和零售场景,还要面对一个更难处理的变量——人的指令。 毕竟,大家都懂,现实交流很少按照标准格式发生。 语气、习惯和表达方式同样因人而异,对于物理AI来说能否真正听懂指令,直接决定了后续动作会不会跑偏。 在今年WAIC上,京东不仅亮相了语音生成基础模型 JoyAI-Voice,还同步发布了新的语音交互模型: JoyAI-Talker ~ 其能够识别用户的情绪与真实意图,根据不同人的表达习惯调整回应,同时具备低延迟交互和随时打断能力。 这意味着,人与物理AI的交互能够从一次性下达指令,变成持续沟通:设备可以在执行过程中接收反馈、暂停动作、理解新的需求,再及时调整接下来的行动了!! 能看懂环境、理解人的意图,物理AI还要跨过最后一道门槛——让真实设备把模型的判断变成动作。 而京东的 JoyAI-RA 移动操控基础模型,解决的正是这段从决策到行动的转换。 通过统一训练框架,让不同机器人与人类操作经验能够在同一套动作表达中完成对齐,再结合仿真训练和真实环境验证,持续修正模型在现实中的执行偏差。 由此,物理AI在模型能力上,才真正完成了从感知、理解、决策到行动的完整闭环。 小机器人们,开始在物理世界狠刷「经验值」 机器人在模型里学会了看、听、理解和规划,真到了现实世界,还是可能被一只摆歪的杯子「难住」。 毕竟,模型给出的更多是智能上限。 这些能力能否迁移到物理世界的真实任务中,很大程度上还是取决于小机器人们在物理世界中攒到的 经验。 读万卷书不如行万里路,这个道理放在小机器人身上,同样成立。 于是, 随着机器人走向现实环境真实作业, 一个越来越关键的环节被推到了台前,那就是 「具身数据采集」。 △ AI生成 与大模型的语料训练相比,机器人学习所需的真实经验,其实要比文本数据难攒得多,而且哪怕数据规模上去了,机器人也可能被「教坏」。 京东就做过一组很直接也很直观的实验—— 他们分别用1万小时高质量数据和1万小时存在瑕疵的数据训练模型,结果发现, 有瑕疵的数据即使继续往上堆,模型效果也未必提高,甚至还会越练越差。 所以在京东看来,数据时长只能反映采集规模。真正决定训练价值的,是动作、轨迹、任务结果和场景变化能否被准确记录和理解,背后还牵涉标注模型、算法精度与数据处理等一整套技术链路。 由此形成的 「数据采集—模型训练—真机验证—反哺采集」 数据采集闭环,则是物理AI真正走进现实世界的关键。
量子位编辑作者招聘
关注前沿科技 2026-07-19 18:18 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至zhaopin@qbitai.com,邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
TimeLens2:基于多模态LLM的通用视频时序定位
Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence intervals across video lengths, domains, query forms, and viewpoints. Existing training strategies are misaligned with this set-valued task: long-video labels often rely on brittle one-pass annotation, while reinforcement-learning rewards either fail to distinguish non-overlapping predictions or require fragile segment matching. TimeLens2 treats temporal evidence as an interval set throughout supervision and optimization. TimeLens2-93K constructs reliable multi-span supervision through caption-derived proposals, independent localization, cross-agent consensus, semantic verification, and boundary refinement. Our temporal Wasserstein reward computes exact one-dimensional \(W_1\) between uniform distributions over merged interval supports, providing dense, matching-free feedback under unequal cardinalities and equivalent fragmentation; temporal IoU complements it with precise-overlap feedback. Across seven benchmarks, TimeLens2-2B outperforms all size-matched baselines on every benchmark, while the 4B and 8B variants achieve state-of-the-art performance, surpassing open-source models with up to 397B parameters. The 2B, 4B, and 8B variants improve over their Qwen3-VL backbones by 14.2, 13.0, and 18.1 mIoU points, respectively.
Kimi正式发布2.8万亿大模型K3,这是属于我们的荣光。
原创 数字生命卡兹克 2026-07-17 06:08 上海 大就是好 今天凌晨,Kimi K3,终于正式跟大家见面了。 2.8万亿参数,百万上下文。 而且,官宣7月27号,全面开源。 没啥可说的,让我们此刻一起欢呼吧。 月之暗面昨天下午就发了预告,片子也非常的艺术,在他们心中,这是一个能证明自己、将整个月之暗面,带向新一个时代的模型。 如果说智谱是做后训练的神,把GLM-5系列带到了一个全新的高度。 那在我心中,其实国内做预训练的扛把子,一直都是Kimi。 而且一直都是大参数的代表。 K2是几个月前国内第一个把模型推到1T级别的。 过去还有很多人说,大模型的Scaling Law要见顶了,要失效了。 可如今发现我们发现,大依然就是好,大依然就是牛逼,大依然就是智能。 就像我至今依然觉得Claude Opus 4.6是我心中最水桶级别的白月光,写作创意认知Agent代码能力都极强,因为那可是个5T的模型啊。 后面Opus 4.7和4.8就强化学习一路强化歪了,Coding能力确实提升了,但是创意和规划能力拉完了,非常明显的一路下滑,口碑一路崩塌。。。 至于现在最牛逼的Claude Fable 5的参数量,目前没人知道,但是跟一些朋友讨论和猜测,可能到了10T级别,因为现在Grok内部训得最高参数量的模型也是10T级别,感觉应该差不多。。。 再把眼光放回到国内,Kimi之后,DeepSeek V4 pro和美团的LongCat 2.0也都迈入了万亿级别,逐渐的,万亿参数模型,已经快成了标配。 而今天,Kimi K3来了。 这一次,他们把模型的参数量推到了2.8T级别,这是国内的第一个3万亿参数级别的模型,而且更是全世界,第一个面向所有人开源的3万亿参数级别的模型。 开心,为Kimi感到自豪。 老规矩,再看下Kimi K3的跑分。 先看AA给的智能分数,Kimi K3来到了第三,仅次于Fable 5和GPT-5.6 Sol,超过了其他所有的模型。 这一下,kimi代替Google,成为新一代御三家了。。。 然后再看Coding。 也正好趁着这个机会,我想用这些评测集来结合我的体感,简单给大家看看一个模型的性格和特点怎么理解。 每个模型其实都是有自己擅长和不擅长的,强如Falble 5,其实也有短板,只不过它的短板的高度,比很多模型的长板甚至还要长。 先说Coding这块,一共六个评测,其实我们可以把它们分成两类来看。 第一类,我自己喜欢叫它精准执行型评测,大概就是测模型能不能精确地完成一个明确的任务,不多不少,不漏不错。 你可以理解成老板给你一个非常明确的任务清单,上面写得清清楚楚要改什么。这种任务考验的就是精准度和执行力,你得理解需求、定位问题、精准修改、不引入新bug。 DeepSWE和Terminal Bench 2.1这两个就是比较典型的,一个更偏纯执行,一个更偏综合性的执行。 GPT-5.6 Sol在这两个评测中都拿到了第一,它在需求理解、环境操作、调试收敛和最终交付方面确实就是最稳的,跟我日常使用的体感是一致的。 至于Opus 4.8,幻觉率太高,我骂了很多回了,这个位置跟我体感也是一致。 而Kimi K3,在执行的精准度上,在DeepSWE上仅次于Claude Fable 5和GPT 5.6 Sol,而在Terminal Bench 2.1上,甚至拿到了第二名。 第二类评测就反过来了,我叫它方案规划型。 比如FrontierSWE,这个测的是前沿级别的、特别难的软件工程问题,需要创造性思考、深度理解复杂系统才能解决的问题。 Fable 5基本没啥可说的,断崖式领先所有的,GPT系列大家都知道创新型任务还有方案设计做的一直都很差,比Fable 5差了很多,是GPT系列的短板,而这次,Kimi K3直接一脚插在了Fable 5和GPT-5.6 Sol之间。 从这个就可以看出来Kimi K3的定位了,可以说非常的中庸之道。 也就是各方面都不错,一个非常全面的水桶模型,在每一个领域里,虽然都打不过那个最强的,但是总能排到第二或者第三。 坦诚的讲,这样的水桶模型,在日常使用中,反而体验感可能会更好一些,我现在经常就是Fable 5和GPT-5.6 Sol来回切换,一边做方案,一边做执行,确实是目前最强组合,但是也麻烦啊。。。 更别提国内,有多少人用不上Fable 5的了。 海外还有人说,Kimi又是靠蒸馏啥的,但是讲道理,这个级别已经不是蒸馏能蒸出来的了。 兰伯特都看不下了,直接是这么怼的。。。 我觉得非常有代表意义。 再来看很多人更看重的Agent能力,这个玩意主要跟Work强相关。 BrowseComp,测的是在浏览器环境下的复杂信息理解和处理,其实就是深度研究。你可以理解成“给模型一个浏览器,让它自己去网上找信息、理解内容、完成任务”,K3拿了91.2,全场第一,GPT-5.6 Sol以90.4紧随其后,Fable 5是88.0。 这个是kimi一贯的拿手好戏了,用过Kimi集群的应该都感受过它的威力。 Automation Bench,测的是自动化任务的执行能力,把一系列操作串起来自动完成,K3也是第一,
平均每天Vibe Coding 16小时后,这是我觉得Fable 5和GPT-5.6时代最好用的AI开发流程。
原创 数字生命卡兹克 2026-07-15 08:02 北京 大道至简 最近两周,因为Claude Fable 5回归、GPT-5.6上线再加上Tibo义父疯狂的重置。 以及AIHOT月活用户,最近也正式突破了50万。 所以导致,我现在每天Vibe Coding的时间,几乎惊人的达到了16个小时。 我现在每天Vibe Coding到早上6、7点,然后睡一觉到中午12点起床收菜,然后去公司,路上用UU远程+Codex继续Coding。 我几乎不会让AI闲着,他们闲着的每一秒,我用不完的每一个token,都感觉是对Tibo义父的不尊重。 每天真的就是不眠不休,感觉自己染上了Coding的瘾,主要还是创造和学习知识的快感,实在是太爽了。 昨天回复一个人的评论我还是这么回复的: 那种爽感我一直不知道怎么描述。 直到前天打车去机场,时间感觉要赶不上的时候,我跟司机说,求求你快点,然后司机一脚油门,那一瞬间我知道该怎么形容这种爽感了。 这是一种属于时代的推背感。 它在不断推着你向前、向前、再向前。 而因为Claude Fable 5和GPT-5.6 Sol在智力和执行上的飞跃,我跟Agent协同开发的流程相比于Opus 4.8时代,也有了比较大的转变。 前期我把巨量的Token都消耗在了一个地方,那就是优化我的整体测试流程上。 在Vibe Coding中,开发的流程已经被大幅加速,写代码已经不再是瓶颈了,瓶颈专业到了测试、验证,还有你对方案的评审上。 测试覆盖率目前做到了还算是比较舒服的区间。 然后因为现在高频提交、Agent自动开PR、反复跑测试的开发方式,为了节省测试和部署的时间,我甚至单独去腾讯云上搞了一台便宜的服务器来做CI,没用GitHub的托管Runner了,然后做了很多任务类型的路由来保证测试全面性和准确性的情况下,节省整体的时间。 哦对了,这里可以提一句,其实Vibe Coding到后面,当你项目越来越大的时候,像Codex的所谓的1.5倍快速模式有的时候并不快,开着没啥意义。 因为大量的时间都是消耗在了确定性测试流程上,Agent提测,测试要大概5分钟时间,然后被测试打回,修复,继续提测,又是5分钟。 整体缩短的时间其实相当有限。 整体测试流程优化的差不多了之后,你会发现,你的想法,终于可以肆意的挥洒了,因为,你大概率无需担心实现不了或者出现BUG,只要你能提出来,那大概率能稳定且完美的实现。 那最大的难点就来了,前期如何设计你的方案,如何自动化的交给Agent进行开发,同时省心省力,上线的效果还有保障。 这两周跟这两顶级模型协同下来,我觉得最好的流程,就是Claude Fable 5做研究出方案初版,GPT-5.6 Sol来纠错和优化,然后在Codex中开起目标模式全自动化执行,之后,你就可以放手去睡觉,等着起床收菜就行了。 就是这么简单。 大道至简,重剑无锋,你根本不需要什么奇奇怪怪的技巧,直接说话就行。 举个新鲜的例子。 还是我的AIHOT。 最近在史诗级强化了防御、优化了Agent接入机制、上线了UI 2.0、解决了用户收不到Skill更新通知的问题、大幅重置了详情页、更新了精选算法、优化了聚簇的算法、还有一堆更新之后,我又想把之前一直想做的一个新功能给大幅重构和加强了。 就是全网AI热点,也就是现在当前热点那个位置。 判断什么东西很热是一个很有意思的话题,我对它的理解特别简单,就两个指标: 有多少人正在讨论它,它的数据趋势怎么样。 这两者合并,基本就能看出一个事件的热点程度了,如果一个事件,讨论的人越来越多,总数据越来越大,那基本就可以看出来这是一个正在大幅增长的热点。 如果人数越来越多,但是数据增长趋势一般,从而两者形成了剪刀差,那可能就是营销投放或者别的原因。 如果人数不咋多,但是数据一直在大涨,那可能就是平台推荐算法的随机漫步,或者是跟具体的人相关,而不足以成为破圈性的热点。 所以,我想用这个机制,来做一个功能,去抓取整个互联网,可能上万个以上的信源,来去找到并监控AI行业,真正正在爆发的热点。 现在AIHOT上的当前热点其实做的非常的粗糙,就是看看目前监控的200多个信源有多少人正在讨论,在24小时这个生命周期的衰退里,这个数字是多少,然后排个大小。 但是要升级成真正的全网AI热点,那肯定不能这么干的,肯定要解决我刚才提到的两点里面的第一点,要监控更多的账号,甚至可能是上万个账号。 而且这些账号,整体是要跟精选体系里监控的账号分开的,这上万个账号,只贡献热度,但是不会被精选,在我的体系里,一般称为热点信源。 大概就这个目标,然后,我就把这一通需求,第一步,先发送给了Claude Fable 5,让它给我出一个方案。 我发过去的字就不用干了,直接豆包语音输入法瞎BB的,非常乱,但是大概的意思表达清楚了就差不多了。 你相信我,在如今这个时代,Claude Fable 5在做方案的初版设计上,在先进程度和优雅程度上,就是当世独一档,越是大型的方案越能体现出它的智力程度。 在大概20分钟之后,这个方案出来了。 但是注意,这个方案是不能直接用的,这也是为什么我说Claude Fable 5的方案只能是初版的原因,因为Claude家族一向的特性,就是丢东西,不细致也不细心。 所以接下来是第二步,把我们的需求和Claude Fable 5的方案,直接复制粘贴给Codex,选中模型为GPT-5.6 Sol极高。 然后说,这是隔壁同事做的,你详细审查一下。 GPT-5.6 Sol经常能挑出Claude Fable 5方案的问题,而且是比较严重的问题。 比如这一次,它花了6分钟,找到了个原有方案里非常关键的隔离问题,甚至会影响我们其他的流程管线和架构。 最后问了我一个问题。 回答完以后,它就给了我最终的方案。
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent ...
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂
中国开源模型狂奔中! Qwen 3.8 也要发布了,2.4T 参数,仅次于 Claude Fable 5! 哇哦!
中国开源模型狂奔中! Qwen 3.8 也要发布了,2.4T 参数,仅次于 Claude Fable 5! 哇哦! Qwen: Qwen3.8 is launching and going open-weight soon!🌐 With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models, second only to Fable 5. You don't have to wait to
WAIC华山论剑,罕见AI新共识:机器人ChatGPT时刻,最快两年!
ASI启示录 2026-07-19 17:53 北京 新智元报道 上海,WAIC 2026。 核心官方分论坛之一、具身智能的「华山论剑」智启具身论坛,今日终于开场。 Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics等海外明星机构,与智元、清华大学、腾讯Robotics X等学术与产业力量同台,一众具身智能核心人物悉数到场。 他们把各自的模型、数据和训练体系摆上桌面。表面看,大家都在追逐「通用机器人」;真正把几份技术路线叠在一起,却是刀光剑影。 谁都承认,具身智能正在逼近临界点。但对「最后一公里究竟该怎么走」,各有绝招。 具身智能的「最后一公里」,各有奇招 先亮战绩,再亮主张。五家最硬的成果和一句话立场摆出来,你会发现连「墙在哪」都没谈拢。 智元机器人 手握GO-2(LIBERO基准98.7%刷新SOTA)、世界模型GE-Sim 2.0(WorldArena全球第一)、龙旗南昌产线稳定运行3个月、成功率99.99%。智元机器人的姚卯青直言,模型决定起点,数据定义终局——靠全栈飞轮硬冲数据、表征、闭环三道墙。 清华大学计算机副研究员苏航,聚焦可恢复性——真正的智能不是不犯错,是知道怎么改回来。 他提出的 TUTOR方法把长程任务的自主成功率从8.3%拉到35%。 Physical Intelligence 最新的π0.7,一个模型开箱即通吃多任务,连没训练过的机械臂都能零样本迁移。Physical Intelligence研究科学家任至意坚信,模型能力足够,唯缺上下文——泛化会自己涌现。 Genesis 押注人手数据手套,从全世界的日常家务里抠经验,号称仿真快1000倍。联合创始人王尊玄介绍了他们如何让物理AI以软件的速度进化。 Dyna的 DYNA-1把折餐巾做到99.4%、24小时85多张,直接开进真餐厅。创始人兼首席科学家马也骋坦言,通用模型不够可靠,专用模型不够可扩展,他们选择先把可靠做到极致。 绝招亮完,战场却各画各的:智元盯着数据、表征、闭环三道墙,PI说墙是上下文,Dyna说是可靠性,清华说是机器人自救。 华山论剑第一招,是先否掉对方对战场的判断。 物理AI三道墙前,背后三场争论 不过,这次有个隐秘共识:下一阶段不再拼Demo花哨,而是拼谁能把「经验」规模化。 这要从大语言模型的成功让人产生的错觉说起: 只要把模型做大、数据喂多、算力堆高,机器人迟早也会出现自己的ChatGPT时刻。 可物理世界不吃这一套。物理智能Scaling面临三道墙:数据墙、表征墙和闭环墙。 姚卯青一句话点破差异:数字智能是「知识系统」,物理智能是「经验系统」。前者靠语言表征就能大规模积累,后者还在满世界找「经验的通用表征」。 经验系统至少管五件事:空间感知、物理交互、精细操作、失败恢复、工具使用。 判断标准叫「经验密度」——录画面和关节角度,那是「一小时录像」;同时记下任务目标、物体状态、动作质量、错在哪、结果如何,才叫「一小时经验」。 数据规模回答「见过多少」,经验密度回答「学到多少」。两者差着一整条产业鸿沟。 背后是三场争论:经验从哪来、怎么算好、能不能省钱。 第一场:有人所有数据全都要,有人偏要少 真机遥操作数据最对口,可太贵:一个人盯一台机器,采集还不如自己上手,想堆出互联网规模,账单比机器人先觉醒。 智元全都要。 姚卯青甩出一个数字:物理AI的数据量只有大模型的两万分之一。为填这条沟,智元和觅蜂科技打造具身智能数据「平台型供给」基础设施,开源了行业首个百万真机数据集AGIBOT WORLD,目前累计下载了120万余次。
Qwen 3.8 Max发布了,2.4T参数,后续会开源,也是宣称仅次于Fable 5。 历史上每一代Qwen Max都很拉,我不测了,你们测吧。。。
Qwen 3.8 Max发布了,2.4T参数,后续会开源,也是宣称仅次于Fable 5。 历史上每一代Qwen Max都很拉,我不测了,你们测吧。。。 Qwen: Qwen3.8 is launching and going open-weight soon!🌐 With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models, second only to Fable 5. You don't have to wait to
随着 Kimi K3 和 Fable 的发布,我们是否进入了 AI 的“够好”时代?这对 OpenAI 和其他闭源 AI 实验室意味着什么?
Charting Models Against the 'Good Enough' AI Threshold The 'good enough' concept is the idea that technologies progress to the point where they work for most people. After that, further improvements produce diminishing returns. Here are a few examples: Can openers: Good enough Car tires: Good enough Email: Good enough Mobile phones: Good enough The list goes on. Have we reached the 'good enough' era in AI? Over the last 18 months or so, we've seen increasingly capable models emerge. We now have Fable, a heavily restricted model gated behind a pay-as-you-go meter. Kimi K3 may be almost as powerful as Fable in some areas, and will be open sourced later this month. Are many of the models we currently have sufficient to meet the needs of most people (i.e., the average AI user)? It's likely. Some important caveats: Good enough doesn't mean that most people know how to take maximum advantage of AI. I just released an AI research study, Secrets of the LLM Whisperer, featuring a simulation of nearly 240,000 LLM users. It revealed that using AI to its maximum advantage (and in a cost effective manner) requires certain habits and behaviors that most people aren't aware of, or don't regularly practice. I'm talking about most people. There are many areas where AI models are still at the 'below threshold' level. Coding is pretty advanced. Research, writing and analysis? Hit or miss. However, with the right harness and scaffolding (and knowing where to use models most effectively), even 'less capable' models can reach the 'good enough' threshold Closed source AI labs (OpenAI, Anthropic) made a big bet that they would be able to control the pace and distribution of AI models, offering increasingly expensive and high-powered AI to the public, to gain monopoly and pricing power. Models like Kimi K3 (and the U.S. government) are a threat to that approach. Open source can bring 'good enough' AI inference to the masses. Kimi K3 isn't something that you can spin up on your laptop. But, if previous trends hold, I expect a Kimi-level model will be released that can be run reasonably well on high-level consumer hardware in the future. The U.S. federal government is now controlling access to the most high-powered models, asking to review them before release. We could see models permanently restricted in the future. For competitive reasons (and because open source models don't have this distribution chokepoint), I could imagine OpenAI and Anthropic supporting the U.S. government putting import and usage controls on Chinese models for national/cyber security reasons. But, if we've already reached the 'good enough' stage in AI, that might not matter. What's your take? Have we reached the 'good enough' era in AI? submitted by /u/SpiritRealistic8174 [link] [comments]
Claude Code uses Bun written in Rust now
In Rewriting Bun in Rust Jarred Sumner made the following claim: Claude Code v2.1.181 (released June 17th) and later use the Rust port of Bun. Startup got 10% faster on Linux but otherwise, barely anyone noticed. Boring is good. I decided to have a poke at my own Claude Code installation to see if I could find evidence that it was using Bun written in Rust. I found these two commands convincing: strings ~/.local/bin/claude | grep -m1 'Bun v1' For me this outputs Bun v1.4.0 (macOS arm64). The most recent release of Bun on GitHub is currently v1.3.14 from May 12th, so that v1.4.0 version number in Claude supports them shipping a preview of a not-yet-released Bun version. ( Update: The Rust version has been released as Bun canary - running bun upgrade --canary will install this release.) strings ~/.local/bin/claude | grep -Eo 'src/[[:alnum:]_./-]+\.rs' This outputs a list of 563 filenames, starting with these: src/runtime/bake/dev_server/mod.rs src/runtime/bake/production.rs src/bundler/bundle_v2.rs It looks like Bun in Rust is indeed being run in production across millions of different devices. Like Jarred said, "Boring is good". Update: Here's a neat trick from Ajan Raj: cat > /tmp/bun-version.ts <<'EOF' console.log("embedded bun:", Bun.version); process.exit(0); EOF BUN_OPTIONS="--preload=/tmp/bun-version.ts" claude --version This outputs 1.4.0 for me. Here's the commit from May 17th that updated the version in package.json to 1.4.0. That version hasn't been changed since then, but also hasn't yet made it into a tagged release outside of canary. Tags: bun, rust, anthropic, claude-code, jarred-sumner
写了个 AI 自动视频剪辑 skill,感觉立马可以抖音小红书起号了,嘿嘿。 买个33台词会员,没有也可以用pexels免费空镜头,加上Listenhub账号,完全可以让AI做各种...
写了个 AI 自动视频剪辑 skill,感觉立马可以抖音小红书起号了,嘿嘿。 买个33台词会员,没有也可以用pexels免费空镜头,加上Listenhub账号,完全可以让AI做各种视频了。 安装指令:npx skills add joeseesun/qiaomu-cut-skill --skill qiaomu-cut 演示效果: 后面会持续打磨,大家一起玩起来。 向阳乔木: 刚写了一个Skill,自动剪辑影视片段学常用英语表达。 还需迭代,后续看搞定后开源。
RT 向阳乔木: 写了个 AI 自动视频剪辑 skill,感觉立马可以抖音小红书起号了,嘿嘿。 买个33台词会员,没有也可以用pexels免费空镜头,加上Listenhub账号,完全...
RT 向阳乔木 写了个 AI 自动视频剪辑 skill,感觉立马可以抖音小红书起号了,嘿嘿。 买个33台词会员,没有也可以用pexels免费空镜头,加上Listenhub账号,完全可以让AI做各种视频了。 安装指令:npx skills add joeseesun/qiaomu-cut-skill --skill qiaomu-cut 演示效果: 后面会持续打磨,大家一起玩起来。 向阳乔木: 刚写了一个Skill,自动剪辑影视片段学常用英语表达。 还需迭代,后续看搞定后开源。
BestBlogs 早报 · 07-19 # 开放权重 / LLM 代码安全 / 具身智能 / OpenVM / Kimi K3 [1] ★ 精讲|开源 AI 现状 — V1.0 · 2026 年 7 月 Mozilla 汇集开发者调...
BestBlogs 早报 · 07-19 # 开放权重 / LLM 代码安全 / 具身智能 / OpenVM / Kimi K3 [1] ★ 精讲|开源 AI 现状 — V1.0 · 2026 年 7 月 Mozilla 汇集开发者调查、市场与基准数据,指出开放权重在编码等任务已接近闭源模型,但生产落地率仍落后,瓶颈集中在部署、合规与维护。文章进一步把竞争焦点推向 Agent harness 的权限、记忆和治理层,帮助读者判断自托管真正需要补齐的工程能力。 来源:Hacker News [2] ★ 精讲|腾讯发布多款具身智能基座模型与智能体,钛螺丝平台迎来全面升级 腾讯一次发布三款具身基座模型与两个智能体,尝试打通感知、规划、动作和持续反馈。官方披露 HyVLA-0.5 已进入日化工厂实测,作业成功率高于 95%、节拍快于 6 秒/件;读者可借此观察具身 AI 从单模型评测走向软硬协同部署的路径。 来源:腾讯技术工程 [3] ★ 精讲|用 LLM 构建源代码安全防护体系 [视频] Anthropic 的 Eugene Yan 将 LLM 代码审计拆成威胁建模、隔离沙箱、发现、独立验证、风险分级和修复闭环。关键提醒是,模型扩大了扫描范围,也把稀缺资源转移到工程师的验证与处置时间;读者能据此设计从交互式试点走向自动化的安全流程。 来源:AI Engineer [4] AI 遇上密码学 2:AI 在 OpenVM 的 zkVM 中发现了什么 一名 AI 审计员在 OpenVM 的 pairing guest 库中发现了一个严重的健全性漏洞,该漏洞通过忽略缩放因子的子域检查,允许伪造任何配对等式。 来源:Hacker News [5] IsoDDE:超越 AlphaFold 的全新药设计引擎 — Isomorphic Labs Isomorphic Labs 推出 IsoDDE,一款统一的 AI 药物设计引擎,在新型蛋白-配体预测上精度超过 AlphaFold 3 两倍以上,并在结合亲和力预测上超越基于物理的方法。 来源:Hacker News [6] AI 手机的真问题从来不是智能,是信任 文章通过阶跃 STEPX Neo 的演示,深入分析 AI 手机的核心瓶颈在于信任而非智能,并提出系统重构与分级治理的解决路径。 来源:硅星人 Pro [7] AI 每天生产 1000 万首新歌,Spotify 等平台最终会消亡丨 100 个 AI 创业者 ACE Studio 创始人郭靖讲述 AI 音乐工具的商业化路径与未来愿景,认为 AI 带来的音乐供给爆发将摧毁 Spotify 等流媒体平台的根基,下一代音乐平台将是一个懂你的 music agent。 来源:晚点 LatePost [8] Claude Code 是怎么设计出来的:下一代设计师负责什么丨 Dive Club Claude Code 设计负责人 Meaghan Choi 分享如何设计没有传统界面的 AI 产品,核心是让设计从画布扩展到心智模型、行为与组织工作流,并强调在 AI 能执行一切时,设计师的判断力与取舍比以往更重要。 来源:晚点再听 LaterCast [9] 2026,中国芯片为国产模型「托底」丨 WAIC 现场 本文通过 WAIC 2026 现场报道,分析国产芯片、大模型和具身智能的最新进展,指出国产 AI 产业正从拼参数转向重性价比,算力生态壁垒逐步瓦解,产业链上下游形成相互支撑格局。 来源:腾讯科技 [10] 智能体评估差距:企业 AI 组织存在现实对齐问题,而非覆盖问题——而且大多数仍在推向生产环境 VentureBeat 对 157 家企业的调查显示,半数企业已部署通过内部评估但在生产环境中失败的 AI 智能体,尽管只有 5% 完全信任自动化评估,但三分之二的企业正朝着零人工介入部署的方向发展 来源:VentureBeat --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
AstrBot
AI 代理助手与开发框架,集成了众多 IM 平台、LLM、插件和 AI 功能,可成为你的 openclaw 替代品。✨
voicebox
开源 AI 语音工作室。克隆、口述、创作。
ktransformers
一个用于体验异构 LLM 推理/微调优化的灵活框架。
WrenAI
面向 AI 代理的 GenBI(生成式 BI),通过开放上下文层实现开源、受管控的文本到 SQL,将自然语言问题转化为跨 20 多种数据源(如 BigQuery、Snowflake、PostgreSQL、ClickHouse、Amazon Redshift、Databricks 等)的可信仪表板、图表和 SQL。
jcode
编码代理驾驭工具。
cs-self-learning
计算机自学指南
cua
通过开源驱动、跨操作系统集群以及用于训练、评估和数据生成的基准,扩展计算机使用 2.0。
terminal
全新的 Windows 终端和原始的 Windows 控制台主机,尽在此处!
jellium-desktop
Jellyfin 的非官方桌面客户端。
// Agents Do Not Fail Alone // Very nice open-source eval tool to check agent reliability. Lots of cool ideas in there. (bookmark it) What's the probl...
// Agents Do Not Fail Alone // Very nice open-source eval tool to check agent reliability. Lots of cool ideas in there. (bookmark it) What's the problem? Context engineering has become central to building reliable agents but it remains almost entirely unmeasured. Instructions, tools, memory, retrieved knowledge, guardrails, and untrusted inputs all accumulate in the context, and when that gets weak the agent drifts, hallucinates, misuses tools, becomes vulnerable to injection, and burns tokens. This work validates context-engineering quality as an independent leading indicator of agent reliability. The measurement lives in ProofAgent-Harness, open-source infrastructure that scores context with multi-juror consensus across seven criteria, covering role clarity, guardrail coverage, instruction consistency, tool schema quality, grounding sufficiency, injection hardening, and token efficiency. The context score is isolated from behavioral metrics and release decisions, so the prediction is not smuggled in. Holding frontier LLM agents fixed and varying only their operating context, each criterion predicts its matching outcome. Why you want to consider doing these checks: > Grounding sufficiency predicts hallucination resistance. > Guardrail coverage predicts manipulation resistance. > Tool-schema quality predicts tool use. Paper: Learn to build effective AI agents in our academy:
RT elvis: // Agents Do Not Fail Alone // Very nice open-source eval tool to check agent reliability. Lots of cool ideas in there. (bookmark it) What's...
RT elvis // Agents Do Not Fail Alone // Very nice open-source eval tool to check agent reliability. Lots of cool ideas in there. (bookmark it) What's the problem? Context engineering has become central to building reliable agents but it remains almost entirely unmeasured. Instructions, tools, memory, retrieved knowledge, guardrails, and untrusted inputs all accumulate in the context, and when that gets weak the agent drifts, hallucinates, misuses tools, becomes vulnerable to injection, and burns tokens. This work validates context-engineering quality as an independent leading indicator of agent reliability. The measurement lives in ProofAgent-Harness, open-source infrastructure that scores context with multi-juror consensus across seven criteria, covering role clarity, guardrail coverage, instruction consistency, tool schema quality, grounding sufficiency, injection hardening, and token efficiency. The context score is isolated from behavioral metrics and release decisions, so the prediction is not smuggled in. Holding frontier LLM agents fixed and varying only their operating context, each criterion predicts its matching outcome. Why you want to consider doing these checks: > Grounding sufficiency predicts hallucination resistance. > Guardrail coverage predicts manipulation resistance. > Tool-schema quality predicts tool use. Paper: Learn to build effective AI agents in our academy:
刚写了一个Skill,自动剪辑影视片段学常用英语表达。 还需迭代,后续看搞定后开源。
刚写了一个Skill,自动剪辑影视片段学常用英语表达。 还需迭代,后续看搞定后开源。
量子位编辑作者招聘
关注前沿科技 2026-07-18 15:45 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至zhaopin@qbitai.com,邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
Stereo2Spatial:将立体声音乐轨道转换为空间化双耳混音 [P]
I have released a model that I have been working on for ~6 months off and on. I've been enjoying listening to spatial music, but there is a lot of music out there with no real quality spatial mix. So I decided to make a model to convert stereo to spatial. I started by making a flow-matching diffusion model that operated in the latent space of a separately trained VAE ( EAR-VAE ). I used the VAE to encode the stereo input in to 1 latent and then separately on each channel of the 7.1.4 output. This design is similar to a paper I found about another stereo -> spatial project ( ImmersiveFlow (they have code links in the paper but they 404 for me so I made the codebase from scratch)). One key addition I made over the ImmersiveFlow paper was a way for the model to carry state (memory tokens) across windows to enable stable long context generations. Since the VAE was out of distribution with the output (was trained to encode\decode stereo tracks directly, not individual channels and certainly not individual channels of a 7.1.4 mix), the results hit real quality bottlenecks. But it showed that the mapping was possible. Rather than stick to modeling in latent space, I decided to pivot to modeling raw waveforms. This ended up fixing all of the quality issues I was seeing with the latent version, but at the cost of more training compute and instability. The waveform version of the model would train to around 60K-80K steps with loss going down like normal, validation generations looking good\improving, and then it would quickly become unstable and the loss would shoot up. I tried direct waveforms, scaling the waveforms by a multiplier, aggressive grad clipping, lower learning rates, and all of those experiments failed the same way. Luckily, I came across a recent paper called WavFlow. The authors of this project also had issues with modeling raw waveforms with flow-matching diffusion, and they solved it by using amplitude lifting (scale each audio track to an rms of 0.33 then multiply by 3) (the WavFlow paper used a clip of 1.0 before the scale which leads to a model space of -3 - 3, but I used a clip of 4.0 which leads to a model space of -12 - 12 (from my testing this led to better binaural outputs)). Once I implemented amplitude lifting like the paper, the training stability issues vanished. The waveform model was trained on 7,669 tracks for ~20 days on 2x A6000 gpus - 10 days stage one, effective batch of 16, 10- 18- 26- and 34-second training sequences - 10 days stage two, effective batch of 16, 122-second training sequences - There is optional mix-style conditioning for controllable outputs (waveform version only) - Direct binaural output (waveform training is more compute expensive than latent training so binaural proves the idea\theory and the same codebase and data can be used in the future to train a 7.1.4 version (once I have access to the compute)) I also made a Windows desktop app for inferencing with the model and consuming the results. Everything has been released apache 2.0. Huggingface link for waveform model: Huggingface link for latent model: Github repo for training\inferencing: Github repo for the Windows app: App Homepage: Case study for the waveform model: Case study for the latent model: Playlist of generations made from the model (will be updated with more tracks over time): If you have any questions\etc. leave a comment and I will do my best to get them answered! Disclaimer: I know AI written posts are generally frowned upon so this post was 100% written by me (mistakes and all). But the case studies and READMEs from the above links were made with AI assistance. submitted by /u/kittenkrazy [link] [comments]
7月19日,和LingBot主创们聊聊2.0发布周的故事|WAIC具身派对
蚂蚁灵波科技 2026-07-17 20:06 北京 LingBot主创团队首次公开亮相! 过去一周,蚂蚁灵波连续发布和开源LingBot全栈2.0六款基础模型,并压轴发布业界首个具身原生世界动作模型LingBot-VA 2.0, “具身原生” 成为WAIC前夕行业最热议的话题之一。 你可能已经读过Paper、看过Demo视频,但一定还有很多想聊的: 为什么放弃“微调捷径”,选择从头预训练这条更难的路? 6款模型环环相扣的全栈布局背后,是怎样的技术判断? “具身原生”这条路线,接下来会把机器人带向哪里? …… 7月19日晚上,蚂蚁灵波联合量子位,在WAIC会场旁的世博天地AOKKA Coffee开一场专属After Party—— 这也是LingBot 2.0发布后,主创团队的首次公开亮相。 没有讲台、没有冗长汇报,一杯咖啡或特调,和他们围坐面对面,听发布背后的取舍、弯路与思考,也把你逛展时攒下的疑问当面抛给他们。 7月19日,周日,17:30-20:00 上海世博天地AOKKA Coffee 高品质、松弛感、轻量干货。 逛完WAIC的周日晚上,来续一杯,和最懂LingBot的人,聊聊发布背后的思考与故事。 *本文系量子位获授权刊载,观点仅为原作者所有。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 阅读原文 跳转微信打开
具身数采新方案:数字遥操作,现已开源,达摩院出品
关注前沿科技 2026-07-17 20:06 北京 RynnWorld-Teleop:用生成式世界模型替代真实机器人 RynnWorld-Teleop团队 投稿 量子位 | 公众号 QbitAI 往机器人身上装一台相机,自己戴上手套做动作,让机器人跟着动——这就是当前做机器人训练数据的方式:物理遥操作。 每一条数据,都得靠真人操作员、真实机器人、真实时间,一条一条“演示”出来。 慢。贵。累。 能否将操作员从真机中解放出来,使数据采集的边界取决于人的创造力,而非硬件的可用性? 阿里巴巴达摩院 的最新工作 RynnWorld-Teleop 对此给出的方案是:用生成式世界模型替代真实机器人。 操作员的手势驱动一个实时视频生成器,由“数字世界中的机器人”完成全部视觉演示,同时自动获得关节级的动作标签。该方案被称为 数字遥操作(Digital Teleoperation)。 在双臂灵巧手上的真机实验表明,仅用RynnWorld-Teleop生成的数据训练策略,就能在真机上实现有效的零样本Sim2Real迁移;把合成数据叠加到真实数据上,还能稳定提升成功率。代码、模型权重均已开源。 数字遥操作:以世界模型替代真实机器人 △ 物理遥操作(上)与数字遥操作(下)的对比。数字遥操作用RynnWorld-Teleop替换真实机器人,两条流水线都产出同步的(视觉观测,机器人动作)对。 数字遥操作与传统遥操作的本质区别,可以从数据链路上加以厘清。 传统物理遥操作的流程为:操作员通过遥操设备做出动作示范,真机实时跟随执行并同步录制关节状态,机载摄像头拍下画面,最终得到(视觉观测,关节动作)对。在整条链路中,真机是不可替代的环节。 数字遥操作则以生成式世界模型替代真机:人的手势驱动世界模型,世界模型实时合成“若机器人执行该手势,其第一人称摄像头将观测到的画面”,而手势本身通过retargeting直接转化为关节动作标签。最终输出同样是(视觉观测,关节动作)对,区别仅在于观测来自生成器而非真实摄像头。 这一替换在形式上简洁,但要真正成立,世界模型必须同时满足三个条件。 第一,以机器人为中心。 生成的画面必须是机器人第一人称视角,而非人手画面,否则下游模仿学习策略因视觉分布不匹配而无法使用。现有的动作控制世界模型 (如Hand2World、EgoSim等) 大多仍停留在以人手为中心的阶段。 第二,动作可回溯。 每一帧生成画面背后的底层动作信号,必须能够还原为具体的机器人关节角度。若动作仅是隐式的latent变量、缺乏对应的关节级标签,则生成视频只能观看而无法用于训练。 第三,实时可交互。 操作员需要在观测画面的同时进行操作,于闭环中完成复杂技能。当生成延迟超过200ms时,操作员将丧失对场景的控制感,采集数据的质量随之下降。当前多数DiT生成模型的推理速度处于2–10FPS,难以支撑实时交互。 RynnWorld-Teleop是首个 同时满足上述三个条件 的系统。为了满足这些需求,研究团队设计了多项核心技术。 三项核心设计:应对深度模糊、本体鸿沟与实时性 △ RynnWorld-Teleop总览。动作被渲染为深度感知骨骼视频并编码进隐空间;预训练视频DiT通过分布对齐的patch embedding分支引入手势条件;模型再被蒸馏为因果学生以支持流式自回归生成。 设计一:深度感知的动作特征,让2D骨骼承载3D信息 操作员的手势经手部追踪设备捕获,得到21个关节点的3D坐标;而世界模型的主干是2D视频生成器,无法直接将3D点坐标输入图像隐空间。 常见做法是将3D关节投影为2D骨骼图后再输入,其局限在于投影会丢失深度信息。人手在相机前方20cm与40cm处做同一抓取动作,2D投影可能几乎相同,而生成画面本应存在明显差异。 RynnWorld-Teleop采用深度感知骨骼渲染 (Depth-Aware Skeletal Rendering),将深度编码进骨骼图的视觉属性:每个关节的颜色与绘制半径随其到相机的距离动态变化,距离近者颜色偏暖、半径较大,距离远者颜色偏冷、半径较小。由此,尽管仍是一张2D图像,深度信息已被显式编码进颜色通道与尺寸通道,世界模型可通过学习从这些视觉线索中还原三维空间关系。 渲染后的骨骼序列被送入预训练VAE编码器,映射到与目标视频在空间和时间维度上对齐的隐空间。为避免该控制信号破坏预训练视频模型的分布,作者采用分布对齐的加性融合策略:先进行均值-方差对齐,再通过初始化为0的gate渐进注入。消融实验表明,该方案显著优于直接拼接——拼接会使FVD (衡量生成视频与真实视频分布差异的指标,越低越好) 从585恶化至1191。 设计二:渐进式跨域训练,先学人手物理,再迁移到机器人 世界模型需要生成的是机器人第一人称视频,但现实中带有精细骨骼标注的大规模机器人操作数据十分稀缺,而人类第一人称操作视频则相对充裕——EgoDex有7400万帧,VITRA有3070万帧。 RynnWorld-Teleop采用 渐进式跨域训练(Progressive Cross-Domain Training),分两个阶段进行。 阶段一:第一人称人类视频预训练。在大规模人类第一人称操作视频上训练,使模型掌握“手势到手-物交互视觉效果”的基本物理规律。该阶段数据量级超过1亿帧,覆盖大量不同物体与交互模式。此时模型尚不了解机器人的外观,但已习得物理世界中物体对手部接触的响应规律。 阶段二:机器人域适配。收集1800条配对的人机遥操作数据 (同步记录人手骨骼与机器人第一人称视角) 并在此基础上微调。该阶段数据量级较小 (约43万帧),但由于第一阶段已建立交互先验,模型能够快速适配机器人的视觉外观与运动学特征。 消融实验具有较强说服力:跳过阶段一、直接在机器人数据上训练,FVD从585升至2598——43万帧不足以让模型从零学会手-物交互的物理规律,却足以在1亿帧预训练基础上完成风格迁移。该路线的核心逻辑在于:先在大数据上学习物理规律,再在小数据上适配视觉外观。 △ RynnWorld-Teleop的生成效果展示。手势流可映射到人类与机器人两种本体;模型把大规模人类视频中的交互先验成功迁移到机器人操作,画面保持高保真与时序一致。 设计三:流式自回归蒸馏,从2.8FPS到40FPS的实时化 基于Wan2.2训练的模型是一个双向注意力的视频扩散Transformer,生成质量高但推理速度仅为2.8 FPS,而实时交互至少需要30 FPS,两者相差约一个数量级。 RynnWorld-Teleop采用流式自回归蒸馏 (Streaming Autoregressive Distillation),将双向教师蒸馏为因果学生——学生模型的注意力被约束为“仅关注过去” (因果掩码与KV Cache),使每生成一帧仅需一次前向推理,而无需重新处理全部历史帧。 蒸馏分两步进行:第一步为因果流匹配预热 (Causal Flow-Matching Warm-up),使学生模型先适应“仅关注过去”的约束;第二步为分布匹配蒸馏 (DMD),通过对抗训练使学生的输出分布逼近教师,并将采样步数从50步压缩至4步。 一个关键的工程细节在于:DMD阶段的梯度不仅在当前chunk内回传,还会跨chunk穿过KV Cache传播,从而保证相邻chunk之间的边界不出现突变,避免长视频生成中出现明显的接缝。 最终的因果学生模型在480×832分辨率下达到40FPS,每帧延迟约25ms。该延迟优于真实机器人相机30Hz的标准采集频率,意味着操作员在数字遥操作过程中 不会感受到可察觉的延迟。 从手势到训练数据:数字遥操作的完整流水线 世界模型仅是引擎,要将其转化为能够产出可训练数据的系统,还需要一条完整的流水线。RynnWorld-Teleop的数据生成流程分为三步。 Retargeting(动作映射): 操作员佩戴HTC Vive追踪器,系统实时捕获其6-DoF手部姿态,通过坐标系变换与阻尼最小二乘逆运动学求解器,映射为机器人的54维关节动作向量 (双7-DoF手臂与双20-DoF灵巧手)。该步骤确保人手的每个动作都有一一对应的机器人动作标签。 骨骼条件合成(Skeletal-Conditioned Synthesis): 以一张场景参考图为起点,操作员手势被渲染为深度感知骨骼序列,驱动世界模型实时生成机器人第一人称视频。该环节具备重要的扩展性:参考图不必来自真实场景,通过图像编辑工具替换其中的物体或背景,即可生成训练集中未出现过的场景数据。 分块重锚定(Chunked Re-anchoring): 纯自回归生成容易出现视觉漂移,即随时间推移生成画面逐渐偏离真实物理状态。RynnWorld-Teleop以81帧为一个chunk,在chunk边界处用真实帧重新初始化模型,以确保长时间演示的物理一致性。
量子位编辑作者招聘
关注前沿科技 2026-07-17 20:06 北京 3个岗位(含实习),不设边界 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI AI热潮还在汹涌,但如果你还不知道如何参与……那为什么不来 量子位 呢? 我们是一家以 追踪AI新进展 为核心的内容平台,经过8年积累,目前拥有顶流影响力,广泛且备受认可的产业资源,以及时代风口的最佳观测和学习生态位。 目前,我们有 三大方向 岗位招聘,希望你是 (或者能成为) 这三个方向的内容专家: AI产业方向:关注基建层创新,包含芯片、AI Infra、云计算; AI财经方向:关注AI领域创投和财报,跟踪产业链资本动向; AI产品方向:关注AI在应用和硬件终端方向的进展。 岗位均为全职,工作地点:北京中关村。 岗位面向: 社招:覆盖编辑、主笔、主编各个层级,按能力匹配岗位; 校招:应届毕业生,接受实习且可转正。 加入我们,你可以获得: 站在AI浪潮之巅:第一时间接触和了解AI领域最新技术和产品,构建完整的AI认知体系。 玩转AI新工具:将各种AI新技术、新工具应用于工作,提升工作效率和创造力。 打造个人影响力:通过撰写独家原创内容,建立个人知名度,成为AI领域的意见领袖。 拓展行业人脉:与AI领域大咖零距离接触,参与重要科技活动和发布会,拓展行业视野。 获得专业指导:应届新人会由主编级编辑出任mentor,提供一对一指导,帮你更快进步获得成长。 加入活力团队:与一群志同道合的年轻人一起工作,享受扁平、简单、开放、多劳多得能者上位的团队氛围。 获得丰厚回报:行业TOP薪资待遇,五险一金、餐补、项目绩效、商务绩效、加班补助等福利一应俱全。 以下是岗位详情: 所有岗位不同能力层级职位均在开放,欢迎结合个人履历和经验申请。 主编:具备选题和带队能力及经验; 主笔:具备原创深度稿件能力; 编辑:热爱表达,喜欢挖掘信息,能够用大白话让所有人看懂AI新进展。 AI产业方向 岗位职责: 跟进AI基建层新进展,包括但不限于芯片、AI Infra、云计算领域新进展,核心玩家动态; 做前沿论文、开源社区、技术大会 (Hot Chips、NeurIPS、MLSys) 技术报告大众化解读; 参与核心采访,对话产业专家、技术大牛、撰写AI云落地案例。 任职要求: 对芯片、GPU、NPU、服务器、模型训练架构、云计算等有基本理解; 熟悉AI行业的供应链与生态 (训练–推理、算力–成本、云–芯片关系); 能把复杂技术内容结构化表达; 有技术背景、理工或CS/EE方向优先。 AI财经商业方向 岗位职责: 聚焦 创投、AI创业公司、上市公司、商业模式、产业链 资本动向; 产出创投融资、招股书财报解析、公司战略分析等稿件; 访谈对话投资人、创业者、产业分析人士。 任职要求: 对数据敏感,对财报、股权结构、战略规划感兴趣; 逻辑结构强,对商业叙事敏感; 热爱对话采访,社交型人格。 AI产品方向 岗位职责: 关注AI在终端的落地:包括软件应用产品、硬件方向落地; 撰写AI应用产品深度评测、跟踪多终端新品发布 (手机、PC、XR、车机等); 对话访谈AI应用创业者、产品专家、终端技术专家。 任职要求: 对智能硬件、AI终端趋势敏锐,重度AI产品体验人士; 熟悉各大终端厂商业态、体验方法论; 有强逻辑、体验表达和结构化能力。 应聘方式 1、请将个人简历发送至zhaopin@qbitai.com,邮件主题请注明“ 量子位XX方向应聘 - [你的姓名] ”; 2、随简历附上你的科技行业代表作品,或者能展现个人写作水平和风格的作品。 关于量子位: 截至2025年,通过及时追踪AI及前沿科技进展,量子位在微信公众号已经有超260万订阅用户,全网用户超700万,日均阅读量200万+。 在新榜和清博等第三方数据平台,量子位已是AI以及前沿科技行业TOP1新媒体。 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见 跳转微信打开
笑死我了。 为了防止没想到的意外情况发生,我一直设置了一条Snitch规则,Claude必须走本地小火箭的端口联网,看来是会有用处的。
笑死我了。 为了防止没想到的意外情况发生,我一直设置了一条Snitch规则,Claude必须走本地小火箭的端口联网,看来是会有用处的。 Leyang: 谁能想到,兑换 6 个月的 20x 开源 claude 后,一个会话还没完成,就被 codex 擅自关闭代理软件,导致被 claude 封号呢? codex 真有你的! @thsottiaux (┬_┬)
Openship:开源自部署平台,把整个部署控制台从你的服务器上搬走 Coolify、CapRover、Dokku这类自托管部署工具有个通病:控制面板、构建系统、CI runner、数据库...
Openship:开源自部署平台,把整个部署控制台从你的服务器上搬走 Coolify、CapRover、Dokku这类自托管部署工具有个通病:控制面板、构建系统、CI runner、数据库全跑在你的服务器上,和你的应用抢资源。Openship反过来——构建在你本地完成,服务器只收到打包好的Docker容器,上面只跑你的应用,别的什么都没有(也可以一个配置开关切回服务器构建)。 “本地构建+SSH推容器”这个架构切入点很聪明,切中自托管PaaS最痛的资源占用问题;但产品面铺得太宽,邮件服务器、CDN全自己做,不是每个团队都维护的了。 Github:
原推作者是OpenAI未来战略负责人,他说的话完全是出于OpenAI立场和利益来讲的。 他的观点: 1. Kimi 的实力是真的,不像简单蒸馏出来的。 在智能体编程任务里,K...
原推作者是OpenAI未来战略负责人,他说的话完全是出于OpenAI立场和利益来讲的。 他的观点: 1. Kimi 的实力是真的,不像简单蒸馏出来的。 在智能体编程任务里,Kimi已经接近 2026 年第一季度最强的公开模型。不过它很“吃 token”,实际推理成本未必像宣传中那么便宜。 2. 中国继续开放权重,可能不是因为特别支持开放,而是现实选择。 作者猜测,一方面中国政府没有那么相信 AGI 风险;另一方面受算力限制,中国公司难以长期承担大规模云端推理服务,所以更适合把模型权重放出去,让别人自己部署。对企业来说,开源也是追赶者获取用户和影响力的办法。 3. 开源模型看似“加速”,实际上可能抑制 AI 投资。 模型一旦可以免费下载、复制和部署,商业公司就更难靠模型本身赚钱,资本也会更谨慎地投入下一代模型训练。因此作者认为,开源模型本质上反而具有“减速主义”效果。 4. 开源模型的终点,可能是国家补贴的“AI 公共品”。 如果企业无法靠前沿模型持续盈利,最终可能变成政府出钱建设算力中心、训练模型,再以公共基础设施的形式提供 AI。作者把这种未来称为“AI 共产主义”,并对此非常反感。 5. 美国可能不会直接禁用中国开源模型,而是制造合规风险。 比如监管机构发布安全提示,暗示中国模型可能存在后门、数据泄露或供应链风险。即使证据不充分,只要让银行、医疗、金融等受监管企业感到不安,它们就会主动避开。 6. 当前风险可能有限,但未来能力越强,风险会突然跨过临界点。 今天开放一个强模型,世界可能只是“稍微危险一点”;但当模型具备更强的网络攻击、生物设计或自主复制能力时,开放权重的后果就可能非常明显。(原推还影射了新冠疫情) 我的观点: OpenAI显然是慌了,开源模型开始削弱单纯靠“卖模型能力”赚钱的空间。对于OpenAI、Anthropic这种前沿模型公司而言,强大的开源模型必定会降低他们的投资回报;但对于创业公司、科研机构和中小公司而言,开源模型能显著提高创新能力。强大的开源模型,让创新重心从少数模型实验室扩散到更广泛的应用和基础设施生态。 曾经浏览器、Linux、安卓都把底层能力免费化,真正赚钱的部分转移到了云服务、硬件、应用、数据和生态。未来基础模型可能也会变成类似操作系统的东西:底座越来越便宜,利润向上层迁移。 Dean W. Ball: Some observations on Kimi: 1. It's a very good model! I don't think its performance can be explained away by distillation or anything like that. In agentic coding sessions, it seems pretty much on par with the best public models of Q1 2026. In my fairly limited use, it also
现在还有人在推荐的所谓开源“剪映 CapCut”替代 OpenCut 现在已经只有一个壳了,基本上啥代码都没有。https://github.com/OpenCut-app/OpenCut 以前的那个半成...
现在还有人在推荐的所谓开源“剪映 CapCut”替代 OpenCut 现在已经只有一个壳了,基本上啥代码都没有。 以前的那个半成品也归档不再更新了。
G0DM0D3
解放的AI聊天
ai-engineering-from-scratch
学习它。构建它。为他人发布它。
lingbot-map
一种前馈3D基础模型,用于从流数据重建场景
wigolo
为你的AI编码代理打造的必备网络——基于MCP的本地优先搜索、抓取、爬取和研究。无需API密钥,无需云,每次查询0美元。公开测试版。
airllm
使用单个4GB GPU进行AirLLM 70B推理
kimi-cli
Kimi Code CLI 是你的下一个CLI代理。
don't sleep on terra!
don't sleep on terra! Peter Steinberger 🦞: 5.6 Terra high is underrated. Switched @clawsweeper (GitHub review bot) to it and it's ~40% faster overall with negligible quality loss. Better than 5.5 on all counts. Massively cheaper. (Tried xhigh but that negates perf wins, didn't make a noticable difference in review evals)
BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、...
BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、896 选 16 的 Stable LatentMoE,是全球首个 3 万亿级开源模型。它用 KDA 线性注意力加 Attention Residuals 把上下文撑到 100 万 token,在内核优化、从零写编译器、芯片设计等长程 Agent 任务上接近 Fable-5,但仍落后最强闭源模型,完整权重将于 7 月 27 日前开源。 来源:月之暗面 Kimi [2] ★ 精讲|Agent 跌跌撞撞进入世界|2026 Q2 AI 趋势总结 腾讯企鹅智库的 Q2 复盘把过去三个月串成一条线:通用 Agent 夺走软件入口后,企业烧 Token 的 Tokenmaxxing 运动很快撞上复核瓶颈和成本墙。Multi-Agent、自进化 AI 和 CPU 重回算力中心在补这些缺口,而就业、安全、信息污染和认知缴械开始浮上水面。 来源:腾讯科技 [3] ★ 精讲|Cursor 如何知道 Claude Fable 5 已准备好应对最难的 1% 问题 | Claude by Anthropic Cursor 的模型评测负责人讲他们怎么判断 Fable 5 够格上岗:自建 CursorBench 里它拿到 72.9% 的新高,更关键的是登月模拟里它先入轨采遥测、再落地,体现出超越局部推理的全局规划能力,适合那些连目标在哪都不清楚的难题。 来源:Claude Blog [4] Garry Tan:如何打造 AI 原生公司 [视频] Garry Tan 将 AI 原生公司定义为:把可重复的智能体工作沉淀为持续维护的技能,并以经过治理的公司记忆不断累积竞争优势的组织。 来源:AI Engineer [5] 代理安全差距:54% 的企业已经发生了 AI 代理安全事件,且大多数仍允许代理共享凭据 VentureBeat Pulse Research 的调查发现,超过一半的企业已经经历了 AI 代理安全事件或险情,但大多数仍允许代理共享凭据,并依赖供应商原生控制而非专用的身份和隔离控制。 来源:VentureBeat [6] LangChain Deep Agents:构建长时程 AI 应用的生产级框架 [视频] LangChain 的维护者将 Deep Agents 定义为一套面向生产环境的智能体运行框架:它在普通工具调用循环之上补足规划、委派、外部化上下文、沙箱执行与可观测性,以支撑长时程 AI 任务。 来源:LangChain [7] 世界模型为何可能提升 AI 的样本效率 [视频] 一场 Y Combinator 对谈解释了世界模型如何让 AI 智能体在机器人、游戏和自动驾驶等场景中先预测、模拟与规划,再采取行动,从而以更少数据学习。 来源:Y Combinator [8] 高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践 阿里大淘宝技术团队分享其基于约定驱动与 AI 编排架构,构建自动化评测体系将 Agent Skill 可用性从主观判断转变为可量化工程闭环的实践,重点剖析了评测集生成、双引擎架构、金标设计陷阱及飞轮挑战。 来源:大淘宝技术 [9] 马斯克连夜开源 Grok Build,但 84 万行代码里还留着上传用户整个代码库的痕迹 本文详细报道了马斯克旗下 xAI 开源 Grok Build 编程智能体的前因后果,并深度解析了其 84 万行 Rust 代码库的构成、此前被曝光的整库上传隐私丑闻的技术细节,以及开源后仍残留的上传代码痕迹。 来源:InfoQ 中文 [10] WAIC 今日启幕,我们提前两天完整拆解 Agent 经济落地全路径 本文完整拆解了 Agent 经济从 Copilot 到 Long-running Agent 的落地全路径,覆盖商业模式、基础设施、垂直场景、出海实战等关键议题,并给出组织变革与信任设计的核心框架。 来源:非凡产研 --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
买 Mac 是没错的,现在主流 Agent 应用都是 Mac 支持最好,比如 Compter Use,只有 Mac 支持的好。 对于开发者来说,开发 App 肯定也优先 Mac。我之前也试过 Ele...
买 Mac 是没错的,现在主流 Agent 应用都是 Mac 支持最好,比如 Compter Use,只有 Mac 支持的好。 对于开发者来说,开发 App 肯定也优先 Mac。我之前也试过 Electron,性能还是远比不上原生的。 如果不需要移动办公 Mac Mini 或者 Mac Studio 也挺好,但是内存一定要高,16 G 都小了,硬盘也一步到位 1T 以上。 黄赟: 宝玉老师的 BaoCut, 用来学英语,做信息搜集,简直太疯狂了 1/ 可以转录Youtube上任意视频,丢个URL就好 2/ 把翻译的中文,合轨到双语字幕 工具免费,skill 开源。你唯一要准备的是,Mac!!
下半年计划和姚老师在深圳办第二届GEO大会,寻场地赞助和志愿者。
下半年计划和姚老师在深圳办第二届GEO大会,寻场地赞助和志愿者。 姚金刚: 迭代了多次后,正式对GEORank全部开源,已推送到GitHub 这是一个可私有化部署的GEO工作台,帮助大家,诊断官网的GEO友好性,并继续生成行动方案、拓词、JSON-LD、llms.txt和知识库等工具 以及教程、问答等功能模块 旨在帮助大家,在各个场景更好的理解和更便利的用好GEO这个AI营销方法
杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机...
杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机制(2017 年)、残差连接(2015 年),三个 Transformer 时代的地基组件,月之暗面各给了一个替代方案,而且全部开源。 但这场演讲讲的不只是 K2.5,而是月之暗面过去一年多的技术路线:开源模型还能从哪里继续变强,又该怎样逼近闭源模型的前沿水平。 杨植麟把答案拆成了三个方向:让每个 Token 更值钱、让更长的上下文真正发挥作用,以及让多个 Agent 同时协作。 此外,他还分享了两个重要进展:视觉训练如何反过来增强文本能力,以及月之暗面刚刚公布的下一代架构 Attention Residue。 【一、数据不够,就让每个 Token 更值钱】 大模型训练正在遇到一个越来越现实的问题:高质量数据快不够用了。 互联网上真正有价值的文本数量有限,模型越做越大,需要的数据越来越多,大家迟早都会撞上“数据墙”。既然高质量数据很难翻倍,月之暗面的思路是:能不能让模型从同样的数据里学到更多? 他们给出的答案是 MuonClip,用它替代已经用了十多年的 Adam 优化器。 MuonClip 基于 Muon 优化器。简单理解,它会在更新模型参数时,尽量让不同方向上的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。 月之暗面的实验结果是:使用同样数量的数据,MuonClip 的训练效果接近把数据量增加一倍,这不仅意味着训练成本下降,也意味着模型能力的上限可能被推高。 假设手里只有 50 万亿个高质量 Token,如果 Token 利用效率提高一倍,就相当于又多出了 50 万亿 Token。在优质数据越来越稀缺的情况下,这种效率提升比单纯增加算力更重要。 但 Muon 也有一个明显问题:模型扩展到万亿参数后,注意力层里的数值容易失控。 月之暗面在训练中发现,注意力层的最大 logit 会突然飙升到 1000 以上,而正常范围通常只有 50 到 100。一旦数值继续膨胀,训练曲线就会发散,整个训练过程可能直接崩掉。 为了解决这个问题,他们设计了 QK-Clip。它会在模型前向计算时,实时检查每个注意力头的最大 logit。一旦数值超过安全范围,就同步缩放 Q 和 K 的投影,把数值压回来。 这个操作不会改变训练的收敛效果,只负责维持数值稳定。 靠着 QK-Clip,月之暗面成功把 Muon 扩展到了万亿参数规模,并训练了超过 15 万亿 Token,整个过程中没有出现一次 loss spike。 【二、上下文不只是要长,还要真正有用】 第二个方向,是提高模型利用长上下文的能力。 杨植麟展示了 Scaling Law 论文作者 Jared Kaplan 等人曾经做过的一组实验:比较 Transformer 和 LSTM 在不同上下文长度下的预测效果。 LSTM 读到一定长度之后,效果很快就不再提升。继续增加上下文,模型也很难从中获得更多信息。Transformer 则不同。上下文越长,模型对后续内容的预测通常越准确,而且很难看到明显的饱和点。 这个特点在 Agent 时代尤其重要。复杂 Agent 任务可能持续几天甚至几周。模型需要记住之前做过什么、得到过哪些结果、哪些方向已经失败,以及接下来该做什么。如果长上下文不能持续提供有效信息,Agent 的任务链条就很容易断掉。 问题是,标准的全注意力机制成本太高。它的计算量会随着上下文长度平方增长。上下文扩大十倍,注意力计算量可能增加一百倍。到了百万 Token 级别,训练和推理成本都会变得非常高。 月之暗面的解决方案是 Kimi Linear,核心是一种名为 KDA,也就是 Kimi Delta Attention 的线性注意力机制。KDA 的关键,是让模型学会“哪些信息要长期保留,哪些信息可以快速忘掉”。 传统线性注意力通常只有一个全局衰减系数,控制整个模型的记忆速度。这有点像所有内容共用同一个遗忘按钮:要么一起记住,要么一起忘掉。KDA 把一个衰减系数拆成了多个。不同信息通道可以使用不同的遗忘速度: - 有些通道衰减得很慢,负责保留长距离信息 - 有些通道衰减得很快,及时腾出空间吸收新内容 实际使用时,Kimi Linear 并没有完全抛弃全注意力,而是把线性注意力层和全注意力层按照 3∶1 的比例混合。 杨植麟称,这是第一个在短上下文、长输入和长输出任务上,都能全面超过全注意力的架构。上下文扩展到百万 Token,甚至更长时,它的效率优势会更加明显。 【三、从一个 Agent,变成一支 Agent 团队】 前两个方向都在提升单个模型的能力。第三个方向,则是让多个 Agent 一起工作。月之暗面把这种方式叫作 Agent Swarm,也就是“智能体集群”。 它的组织方式很像一家公司。一个主 Agent 充当 CEO,负责理解目标、拆解任务,并把不同子任务分配给多个子 Agent。子 Agent 可以分别扮演研究员、程序员、数据分析师和事实核查员等角色。任务完成后,主 Agent 再汇总结果。 这样做最大的价值是把串行任务改成并行任务。过去,一个 Agent 可能需要依次搜索资料、阅读文档、分析数据、编写代码、检查事实。现在,这些工作可以交给几十个甚至几百个 Agent 同时完成,从而大幅缩短复杂任务的执行时间。 不过,要让模型真正学会并行协作并不容易。训练 Agent Swarm 时,月之暗面设计了三种奖励: 第一种是“实例化奖励”,鼓励主 Agent 创建更多可以并行执行的子任务,避免它退化回单 Agent 串行工作。 第二种是“完成奖励”,要求子任务必须真正完成,防止模型为了获得实例化奖励,批量创建没有意义的空任务。 第三种是最终结果奖励,用来判断整个任务是否真正解决。 这三种奖励的权重会随着训练过程动态变化。训练前期更重视任务拆解、并行化和子任务完成率,后期则逐渐把重点转向最终结果。 从演示结果看,Agent Swarm 在复杂任务上能明显缩短执行时间。比如: - 同时下载、阅读几百个信息源并完成研究 - 并行撰写一份上百页文献综述的不同章节 - 同时分析十个不同的数据集 Kimi K2.5 发布时,Agent Swarm 已经支持最多 100 个 Agent 并行工作,整个任务最多可以执行 1500 个步骤。4 月发布的 K2.6 又把并行 Agent 的上限提高到了 300 个。 【四、一个意外收获:练“视觉”,也能让“大脑”变聪明】 K2.5 和前代 K2 之间,一个重要变化是采用了“早期融合”训练。 过去很多开源多模态模型采用的是“后期融合”:先用大量文本训练出一个语言模型,再用相对少量的视觉数据补上看图能力。 例如,先训练 20 万亿个文本 Token,再用大约 2 万亿个多模态 Token 把视觉能力“贴”上去。 K2.5 的做法不同。 它从训练一开始,就把视觉和文本数据混在一起。在 K2 文本基座的基础上,K2.5 又训练了约 15 万亿个混合 Token。 这种方式带来了两个让杨植麟感到兴奋的结果。 第一个发现是:只训练视觉任务,也能提升模型的文本推理能力。 研究团队只让模型完成数数、识别图片和视觉问答等任务,没有加入数学或编程训练。结果模型的文本推理能力也变强了。 换句话说,模型在练习“看”的同时,“想”的能力也得到了提升。 第二个发现则来自相反的方向:如果文本基座足够强,模型甚至不一定需要专门的视觉 SFT 数据。 K2.5 采用了“零视觉 SFT”方案。所有监督微调数据都是纯文本,然后再通过文本与视觉联合的强化学习,让模型获得视觉能力。最终,它在视觉任务上的表现依然接近最先进水平。 杨植麟认为,这种双向迁移来自早期融合。 当文本和视觉被放进同一个表征空间后,一种模态学到的能力,就有机会迁移到另一种模态。这也是 K2.5 能够“看图写代码”的基础。 如果视觉和文本仍然像两个彼此分开的“大脑”,这样的跨模态能力就很难自然出现。 【五、下一步:用注意力机制替代残差连接】 演讲快结束时,杨植麟介绍了月之暗面刚刚发布的一项新研究:Attention Residue,也就是“注意力残差”。这篇论文发布于 3 月 15 日,距离演讲只有两天。 残差连接是现代深度神经网络最重要的基础技术之一。2015 年,何恺明等人提出残差网络,此后残差连接逐渐成为 Transformer 的标准组件。它的基本做法是:每一层不仅处理上一层的结果,还保留一条直接传递信息的通道。这样即使模型很深,信息和梯度也能顺利通过,模型才有可能稳定训练。 杨植麟引用了 Ilya Sutskever 的一个说法:残差连接可以被理解为“旋转了 90 度的 LSTM”——LSTM 在时间维度上传递信息,残差连接则在网络深度上传递信息。 月之暗面顺着这个类比继续往前走了一步。 既然 Transformer 已经用注意力机制替代了 LSTM 在时间维度上的循环结构,那么在深度维度上,是否也能做同样的替换? Attention Residue 就是这个思路的产物。 标准残差连接主要使用上一层的输出。Attention Residue 则允许当前层查看所有前序层的输出,再通过注意力机制决定:哪些历史信息值得保留,哪些信息可以忽略。 也就是说,模型不再只能被动接收上一层的结果,而是可以主动从整个计算历史中挑选信息。 为了控制计算成本,月之暗面实际采用的是分块版本 Block Attention Residual。它会把模型层分成多个块,比如每 16 层组成一个块。块内继续使用标准残差连接,块与块之间才使用注意力残差。 实验显示,大约 8 个块就能获得大部分收益。 Attention Residue 带来了约 24% 的 Token 效率提升。 按照杨植麟的算法,如果有 50 万亿个高质量 Token,效率提高 24%,就相当于额外增加了 12 万亿个 Token。它在 GPQA、MATH 和 HumanEval 等推理、数学与编程测试上的提升尤其明显。 【三个用了近十年的组件,都还有改进空间】 演讲最后,杨植麟把月之暗面的三个替代方案放在了一起: - Adam → MuonClip - Full Attention → Kimi Linear - Residual Connection → Attention Residue 它们分别对应大模型训练中的三个基础问题: - 怎样从有限的数据中学到更多 - 怎样更高效地利用超长上下文 - 怎样让深层网络更灵活地传递信息 三个方案都可以相对独立地替换现有组件,也都已经开源。 这些技术能否直接叠加,增益能否简单相乘,目前还没有经过完整验证。但它们至少说明了一件事:很多被认为“已经足够好”的基础组件,可能远没有到达终点。 在优质数据越来越少、训练成本越来越高的情况下,继续堆参数和算力并不是唯一的路。重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。 这也是杨植麟整场演讲真正想表达的观点。 正如他最后所说: > “Open models cannot be just open; they have also to be great.” 开源模型不能只是开放,还必须足够强。 注:本视频由 翻译 Jackywine: KIMI CEO杨植麟,一个视频带你彻底看懂大规模 AI 系统训练的秘密 自己看一遍比什么都重要
That missing token efficiency is coming. Can't say more now, but efficient frontier long context reasoning/understanding and other TTC breakthroughs a...
That missing token efficiency is coming. Can't say more now, but efficient frontier long context reasoning/understanding and other TTC breakthroughs are on the horizon. Architectural improvements are often ignored in these benchmarks, but I expect major shifts by EOY. Gavin Baker: Kimi K3 may be an important inflection point for AI. Potentially negative for Anthropic and OpenAI while being net positive for essentially every other company in the world. I mean that very literally. Although the real “Sputnik moment” would be an open-source frontier model that
RT Gantrol: 助力国产百元手柄平替Codex Micro,开源Agent controller。只要人民币,不要230美元。甚至无需运费 大致思路是,将手柄操作转成Codex操作。目前仅支...
RT Gantrol 助力国产百元手柄平替Codex Micro,开源Agent controller。只要人民币,不要230美元。甚至无需运费 大致思路是,将手柄操作转成Codex操作。目前仅支持Windows 64位,由于是一天内(让Codex)赶工出来的,会有不少问题,开软件,重启Codex(ChatGPT)会好很多 开源地址:
Browser Use新增视频录制功能 可以让Agent一遍操作一遍录制视频,最后AI再剪辑一下视频,操作教学类视频就自动生成了。 功能介绍:https://github.com/browser-u...
Browser Use新增视频录制功能 可以让Agent一遍操作一遍录制视频,最后AI再剪辑一下视频,操作教学类视频就自动生成了。 功能介绍:
别手搓排版了,这个Skill 让 AI 直接产出杂志级信息卡! 你只管把文字丢给 AI,排版交给 infocard-skills: https://github.com/shaom/infocard-skills 这是一套...
别手搓排版了,这个Skill 让 AI 直接产出杂志级信息卡! 你只管把文字丢给 AI,排版交给 infocard-skills: 这是一套开源的 Agent Skill,让 AI 学会「编辑部级排版」:读入任意自然语言内容,自动判断信息密度、挑选布局骨架,按现代杂志与瑞士国际主义风格生成定版 HTML 信息卡,再一键渲染成 3:4、16:9 等多种画幅的成图。 它内置六步工作流和严格的质量红线——标题不许改写、版面不许留大片空白、模块必须有主次——从密度判断到渲后自检,全程自动把关。 无论是知识卡片、榜单总结还是内容封面,从此文字进去,设计感直接拉满地出来。
非大厂程序员,怎么用技术变现?接单,教学,工具站,SaaS,还是 AI+RPA,有哪些小众但高精准的需求挖掘手段,怎么伸手收第一笔钱 这本开源电子书替你回答了这些...
非大厂程序员,怎么用技术变现?接单,教学,工具站,SaaS,还是 AI+RPA,有哪些小众但高精准的需求挖掘手段,怎么伸手收第一笔钱 这本开源电子书替你回答了这些问题:狠狠戳 ——
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本登顶 RTEB 检索基准
NVIDIA 近日发布了 Nemotron3Embed 系列嵌入向量模型,专为生产级 RAG、智能体检索、代码检索及智能体记忆等场景设计。其中8B 版本在检索嵌入基准测试 RTEB 上排名 第一,成为当前该领域性能 最强 的开源模型。 该系列包含三个开放检查点:Nemotron-3-Embed-8B-BF16(精度优先)、Nemotron-3-Embed-1B-BF16(轻量化版本)以及 Nemotron-3-Embed-1B-NVFP4(针对 Blackwell 架构优化的4比特版本)。三者均采用双向注意力掩码训练的 Transformer 编码器, 最大 序列长度均为32,768个 token,支持34种语言,并采用 OpenMDW-1.1许可协议开源。值得注意的是,其基础模型均基于 Mistral 架构,8B 版本源自 Ministral-3-8B-Instruct-2512,两个1B 变体则基于 Ministral-3-3B-Instruct-2512。 在 RTEB 基准的16项公开任务测试中,8B-BF16版本以平均 NDCG@10得分78.46位列榜首。1B-BF16版本得分72.38,相较上一代基线 llama-nemotron-embed-vl-1b-v2提升了10.4分。而针对 Blackwell 优化的1B-NVFP4版本仅损失0.38分,相当于保留了99.5% 的精度,同时在 Blackwell 架构上吞吐量比 BF16提升2倍。 1B 模型的构建采用了压缩而非小规模训练的路径。研发团队先使用 NVIDIA ModelOpt 的神经架构搜索将3B 基础模型剪枝至2B,再从微调后的8B 嵌入向量教师模型中通过余弦距离损失和均方误差损失进行知识蒸馏,最终迭代至1.14B 参数。NVFP4版本则在此基础上进行了量化感知蒸馏,使用512个样本校准、2万个样本训练,在长输入场景下恢复了精度。 在部署层面,三个版本存在差异:8B 和1B 的 BF16版本支持 Transformers 和 Sentence Transformers 框架,而1B-NVFP4仅支持 vLLM0.25.0的 /v2/embed 接口。微架构覆盖方面,NVFP4版本兼容 Ampere、Hopper、Lovelace 和 Blackwell,而 BF16版本主要面向 Ampere、Hopper 和 Blackwell。NVIDIA 还发布了针对1B 模型的优化版 NIM 微服务,基于 Rust 构建,在 GB200和 RTX PRO6000上达到或超越了 vLLM 检查点的性能。 应用场景方面,该系列模型支持多语言企业搜索(跨语言检索)、代码检索(训练数据包含 SWE-bench 等代码数据集)以及智能体记忆(32K token 长上下文支持较长对话摘要嵌入)。对于成本敏感场景,可采用"1B-NVFP4处理高容量召回 +8B 处理困难查询"的分层 RAG 策略。 NVIDIA 同时提供了完整的代码示例,涵盖基于 Sentence Transformers 的本地推理和基于 vLLM 的服务端部署,查询和文档分别通过 `query:` 和 `passage:` 前缀区分,嵌入向量经 L2归一化处理后点积即等于余弦相似度。
想用Codex的,按我之前发的教程注册和订阅。嫌麻烦的,可以考虑直接订阅199档的会员(年付是179/月),现在除了速度慢一些,没别的毛病了。 下面的效果是Kimi K3...
想用Codex的,按我之前发的教程注册和订阅。嫌麻烦的,可以考虑直接订阅199档的会员(年付是179/月),现在除了速度慢一些,没别的毛病了。 下面的效果是Kimi K3一次出,联网搜索数据+写代码+部署Github发布。 在线体验: Github:
最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效...
最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 一个问题是不直接支持识别发言人 虽然这些问题都可以通过收费的云端模型来解决,但是成本相对高一些。 最近测试了 Qwen3 ASR,效果是真的很不错,配合 Qwen3-ForcedAligner 模型,可以识别后把词级时间戳对的很精准。0.6b 就足够了,本地运行资源占用也不高。 发言人识别也有开源的模型:Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准,但配合 Agent 结合上下文就能做到相对比较准了。 如果真的要求高,也可以走云端模型,比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好,速度也快,就是要额外花钱。 宝玉: 我在开发 BaoCut 这个 App 的时候,是基于一个 Loop 来的: 1. 在开发新功能之前先设计原型(参考图1),借助的是 baoyu-design skill ( ),配合 Claude Code App 内置的浏览器实施预览调整,模型 Opus 4.8 就很好了,都不需要 Fable 5. GPT 5.6 Sol 设计能力还是不如 Opus
数字永生?面壁智能开源企业数字员工平台StaffDeck
一家国产AI团队把企业级AI的赌注,押在了一个与聊天机器人截然不同的方向。7月16日晚,面壁智能宣布开源StaffDeck——一个用于构建和管理数字员工的企业级平台,代码已托管至GitHub仓库github.com/OpenBMB/StaffDeck。 与市面上大量套着企业外壳的对话机器人不同,StaffDeck瞄准的是数字劳动力。它试图将组织内部的专业知识、标准作业流程(SOP)以及各类决策规则,转化为一批能够持续工作、不断改进并保留组织知识的数字员工。在面壁智能的表述里,企业级AI的下一站不是更会接话的聊天框,而是能沉淀经验、替组织把规矩记牢的生产力本身。 支撑这一平台的,是一支横跨学界与产业的联合阵容。项目由面壁智能、东北大学与面壁共建的数据智能联合实验室、清华大学自然语言处理实验室(THUNLP)、OpenBMB以及AI9Stars共同打造。多家机构把学术研究能力与企业落地经验一并压了进来,这也让StaffDeck从一开始就不只是单个公司的内部工具,而是面向企业AI落地场景的开放平台。 从技术定位看,StaffDeck的核心差异在于知识的持续驻留。传统聊天机器人的尴尬在于,对话一关,上下文随之消散,组织的隐性经验难以沉淀;而StaffDeck要做的,是把散落在老员工脑中的专业判断、白纸黑字的流程规范,以及那些不成文的决策逻辑,翻译成可以被系统长期执行和迭代的数字员工。这意味着知识不再随人员流动而流失,而是留在了系统里。 此次开源由OpenBMB在社交平台发布,并附上了完整的GitHub仓库链接。对于正在评估企业AI落地、却不愿再堆砌一层聊天皮的团队而言,StaffDeck提供了一个可直接检视与二次开发的技术底座。当行业仍在比拼对话机器人的响应技巧时,面壁智能这一步,选择了一条更偏重组织能力沉淀的路径。 项目地址:
Roblox推出AI创作工具Build,支持文本生成游戏和3D场景
Roblox宣布推出全新AI创作工具Build,并升级Studio创作者工具体系,利用人工智能降低游戏开发门槛,让更多用户通过文本提示直接生成可编辑的游戏内容。该功能将于7月28日起开启测试,进一步推动“游戏由用户创造”的平台理念。 Roblox表示,过去20年平台持续围绕用户生成内容(UGC)发展,目前已有1.32亿日活跃用户。此次推出的Build是一款移动优先的AI创作工具,用户可直接在Roblox移动应用中输入自然语言提示,例如描述游戏场景、玩法和环境元素,系统即可生成基础游戏版本,创作者随后可以进行修改、测试,并分享或发布作品。 Build基于多种AI模型运行,包括开源模型以及Roblox自研模型,能够处理游戏机制、环境设计、角色创建、视觉风格和声音等内容。由于模型基于大量3D数据和游戏专用数据训练,Roblox AI能够生成可直接应用于游戏开发的3D对象和完整场景,并与现有创作工具结合使用。 该工具与Roblox Studio深度连接,创作者可以在移动端开始创作,再通过Studio进行更复杂的编辑;同时也可以在Studio中调用AI代理,并通过移动设备查看开发进度。Roblox强调,AI生成内容仍将经过与普通游戏相同的审核流程,并通过用户留存等指标参与平台推荐,不会降低内容质量标准。 除Build外,Roblox还计划推出面向专业开发者的AI工具,包括游戏测试代理、数据分析代理和实验代理,帮助创作者发现漏洞、分析玩家行为并优化用户参与度和商业表现。 此外,Roblox正在研发更多生成式AI能力,包括基于文本或图片生成参数化3D模型的程序化模型,以及能够根据单一提示生成完整可编辑3D游戏场景的AI模型Cube。 随着AI技术快速融入游戏开发流程,Roblox希望通过智能化工具进一步扩大创作者规模,让更多普通用户参与游戏生产,并推动UGC游戏生态向更高效、更自动化方向发展。
Arena 这个指标有点离谱了… 如果开源模型能超过 Fable 这么多… 那 A 社还有什么价值…
Arena 这个指标有点离谱了… 如果开源模型能超过 Fable 这么多… 那 A 社还有什么价值… Arena.ai: Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5. This is a 17-place jump from Kimi-k2.6 (#18 -> #1). In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics,
5个月增长15倍,智谱AI凭Coding路线冲击10亿美元ARR
据多家独立信源透露,截至2026年7月,智谱年度经常性收入(ARR)已达到10亿美元规模。对此消息,智谱方面截至发稿前未作回应。 过去一年,AI Coding和视频 生成成为生成式AI领域商业化能力增长最快的两大方向。海外市场中,Anthropic旗下Claude Code在推出半年后ARR达到10亿美元,推动公司估值持续提升。而智谱此次ARR增长速度,也显示国内大模型企业正在探索新的商业化路径。 数据显示,智谱ARR从1亿美元增长至10亿美元仅用了约5个月,而Anthropic达到同等规模用了15个月。据知情人士透露,2026年1月至7月期间,智谱ARR增长约15倍。此前市场曾预计,智谱可能需要到2026年底才能达到10亿至15亿美元ARR。 智谱的快速增长与其较早布局AI Coding密切相关。2025年初,公司开始集中提升模型代码生成能力,并围绕Coding与Reasoning方向推进模型研发。智谱创始人唐杰曾表示,Coding能力是能够与AI Agent协同发展的关键能力之一。 随后,智谱以约两个月一版的节奏推出多款Coding模型。2026年6月发布的GLM-5.2进一步强化代码能力,即使采用开源模式,多个核心指标仍达到或超过部分闭源模型水平。财报显示,今年 第一 季度,GLM API价格累计提升约83%,海外订阅价格接近Claude Code,但调用量仍增长约400%。 随着Token消耗成为衡量AI商业价值的重要指标,AI Coding正在成为企业和开发者提升生产效率的重要工具。同时,视频生成领域也展现出强劲商业潜力,相关产品正在进入规模化内容生产场景。 不过,市场竞争正在进一步加剧。MiniMax近期发布M3模型,重点强化Coding和Agent能力;月之暗面推出K3模型,继续提升模型综合能力。海外方面,随着GPT-5.6发布以及ChatGPT与CodeX生态整合,OpenAI也正在加强在AI编程领域的竞争。 AI Coding赛道的商业价值正在被验证,但随着更多厂商加速入局,围绕模型能力、生态建设和商业化效率的竞争仍将持续升级。
2. 8 万亿参数、 100 万词元上下文,Kimi K3 把开源大模型的天花板顶到了全球最高
世界人工智能大会还没开锣,国产大模型就先放出一颗重磅炸弹。2026世界人工智能大会暨人工智能全球治理 高级 别会议即将举行之际,月之暗面于16日正式发布新一代模型Kimi K3,参数规模达到2.8万亿,一举坐上目前全球参数 最大 开源模型的交椅。这不仅是一次数字上的登顶,更意味着开源阵营 第一 次在体量上把闭源巨头甩在了身后。 Kimi K3不是只靠堆参数撑场面。北京月之暗面科技有限公司介绍,这款模型原生支持视觉理解,并具备100万词元的超长上下文窗口,相当于一口气吞下整本专著还能记得开头写了什么。它被针对性地优化用于软件工程、知识工作、深度研究、多模态理解等复杂任务场景,复杂任务的处理能力由此再上一个台阶——从读图识物到长程代码工程,K3试图把过去要拆成多步才能啃下的硬骨头,一把攥进同一个模型里。 资本端已经闻风而动。中信建投在研报中给出了一组颇具信心的判断:全球大模型调用量预计将连续11周环比走高,国产模型凭借高性价比稳稳占据流量前列,海外头部厂商的营收预期也被顺势上调。更值得玩味的是商业化节奏的此消彼长——国内厂商明显提速,DeepSeek准备推出分时定价,豆包已经上线多档会员;另一边,Anthropic收紧了Claude的访问限制,在合规与地缘因素的交织下,国产替代的逻辑被进一步照亮。 沿着这条主线,财联社主题库梳理出几家与之共振的上市公司。三六零在AI领域以360智脑与360安全大模型为核心布局,自研的千亿参数通用大模型360智脑已具备多模态理解、逻辑推理、代码生成等能力。昆仑万维则在7月2日宣布,旗下天工AI在2026年第二季度实现历史性突破,其AI Native模型与产品业务的年度经常性收入(ARR)已跨过8亿美元大关。当2.8万亿参数的开源巨兽落地,国产大模型的景气度,正被推向一个肉眼可见的新高点。
Kimi K3 终于来了,最强开源模型! 全球首个 3T (2.8T) 级开放模型、1M token 上下文、原生多模态,定位于长时程智能体编码、知识工作与推理,权重将于 7 月 27 ...
Kimi K3 终于来了,最强开源模型! 全球首个 3T (2.8T) 级开放模型、1M token 上下文、原生多模态,定位于长时程智能体编码、知识工作与推理,权重将于 7 月 27 日前开放。 整体表现仅弱于 Claude Fable 5 和 GPT 5.6 Sol,在开源模型中整体表现最强,评测中稳定领先 Claude Opus 4.8、GPT 5.5、GLM-5.2 等其余所有模型。 在 @arena 的 Frontend Code Arena 中最强,拿到 1679 分,强于第二名 Claude Fable 5 的 1631 分,第三名 GPT-5.6 SOol 1618 分。 详细报告和案例展示看这里: Kimi.ai: Introducing Kimi K3: Open Frontier Intelligence 🔹 2.8 Trillion Parameters, 1 Million Context, Native Multimodal 🔹 Kimi Delta Attention enables up to 6.3x faster decoding in million-token contexts 🔹 Attention Residuals deliver ~25% higher training efficiency at <2% additional
BestBlogs 早报 · 07-17 # Nemotron 3 Embed / Kimi K3 / Inkling / Fable / Bun [1] ★ 精讲|NVIDIA Nemotron 3 Embed 在 RTEB 上排名第一,推动智能体检索发...
BestBlogs 早报 · 07-17 # Nemotron 3 Embed / Kimi K3 / Inkling / Fable / Bun [1] ★ 精讲|NVIDIA Nemotron 3 Embed 在 RTEB 上排名第一,推动智能体检索发展 NVIDIA 开源嵌入模型族 Nemotron 3 Embed,8B 版以 78.5% 登顶 RTEB 检索榜,并配 1B 与 Blackwell 专属 NVFP4 版本(吞吐翻倍、保留 99% 以上精度)。更关键的价值在智能体一侧:更准确的检索让证据更早出现,智能体不必反复搜索、少绕几轮推理,直接压低下游 token 成本,是 RAG 与智能体记忆共同的检索底座。 来源:Hugging Face - Blog [2] ★ 精讲|The Pulse:从 Bun 借助 AI 快速重写为 Rust 我们能学到什么? Bun 作者 Jarred Sumner 用 Anthropic 的 Fable 模型,在 11 天里花费 16.5 万美元,把 53.5 万行 Zig 代码重写为内存安全的 Rust,把原本预计要一年的重构压缩到两周。关键不在于一句提示词,而是 3 小时移植规范、对抗式评审和 64 个并行智能体的工程编排——让过去认为不可能的大规模重写变得现实可行。 来源:The Pragmatic Engineer [3] ★ 精讲|Agent 治理:用 Hook 堵住 LLM 的偷懒、越权与失忆 腾讯数仓 Agent 平台 DECO 总结 LLM 三类顽疾——长脚本偷懒截断、危险操作越权、改表后失忆。核心结论是在 prompt 里写禁止根本管不住,解法是在框架 Hook 切面上做代码级强制:长内容落盘、HITL 门禁、上下文联动补齐盲区,并把基础设施与推理逻辑解耦。 来源:腾讯技术工程 [4] Thinking Machines 发布开源多模态大模型 Inkling Inkling 是一个大型开放多模态模型(约 1T 参数,1M 上下文),原生支持图像、文本和音频输入,具备智能体能力,并在主流推理引擎中提供首发支持。 来源:Hugging Face - Blog [5] Kimi K3,以及我们从鹈鹕基准测试中仍能学到的东西 Simon Willison 评测了月之暗面(Moonshot AI)新发布的 Kimi K3 模型,运行了他标志性的「骑自行车的鹈鹕」测试,并反思了该测试作为快速模型评估工具的实用价值变化。 来源:Simon Willison's Weblog [6] Computer-Use 2.0:从屏幕操控迈向后台智能体 [视频] 这场演讲描绘了计算机使用智能体如何从前台截图循环走向后台执行,并说明可靠评测与沙盒基础设施怎样支撑智能体训练规模化。 来源:AI Engineer [7] Lychee-FD 全双工语音大模型斩获 ACL 2026 杰出论文 哈工大张民教授团队开源了原生端到端全双工语音大模型 Lychee-FD,该研究因揭示了语音与语义建模的冲突并提出层次化解耦架构,荣获 ACL 2026 杰出论文奖。 来源:机器之心 [8] Physical Intelligence 柯丽一鸣 4 小时访谈:Pi 开源模型与机器人的江湖 [播客] Physical Intelligence 研究员柯丽一鸣深度拆解机器人大脑的研发历程、全球机器人学术与产业江湖,并探讨 AI 与人类未来的共生关系。 来源:张小珺 Jùn|商业访谈录 [9] 一文讲透 Skill 本文系统讲解 AI Agent 与 Skill 的关系,从概念本质、运作机制、选择策略到安全实践,配套完整早报 Skill 实战案例,帮助读者掌握定制 AI 助手的核心流程。 来源:腾讯云开发者 [10] 从 Data Lake 到 State Lake:面向 Agent 时代的存储基础设施重构 本文详细阐述了火山引擎存储团队如何围绕 Sandbox Store、Artifact Store 和 Agent 观测与评测三大能力,将存储从 Data Lake 演进为 State Lake,以支撑 AI Agent 的全生命周期。 来源:字节跳动技术团队 --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
turbovec
基于 TurboQuant 构建的向量索引,采用 Rust 编写,提供 Python 绑定
protobuf
Protocol Buffers —— Google 的数据交换格式
docuseal
开源的 DocuSign 替代品。创建、填写并签署数字文档 ✍️
code-review-graph
面向 MCP 和 CLI 的本地优先代码智能图谱。构建代码库的持久映射,使 AI 编程工具只读取相关内容,并针对审查和大型仓库工作流提供经过基准测试的上下文缩减。
为扩展和独立评估一种新的循环语言模型架构(预印本+代码)寻求合作者 [R]
Hi everyone, I've been working independently on a recurrent architecture called **DABSN (Dynamic Adaptive Bias State Network)** for the past several months, and I finally reached the point where I feel comfortable sharing the first preprint. The paper is mainly about the architecture itself and its behavior on reasoning, memory, and long-sequence benchmarks (MQAR, Copy, Key-Value retrieval, A5/60, etc.). The code is also public with PyTorch, C++, and Triton implementations so everything can be reproduced. While finishing the paper, I also trained my first language model with the same cell: - 24M parameters - 1B pretraining tokens - GPT-2 tokenizer Those results ended up being much more interesting than I expected, so I'm now writing a second paper focused entirely on language modeling, long-context behavior, and scaling. This is where I'd love some help. I'm looking for people who might be interested in collaborating on the next paper, whether that's: - independent reproduction of the results, - helping design stronger baselines and evaluations, - or having access to larger GPU clusters so we can scale the architecture much further than I can on my own. Everything I'm doing is intended to be open and reproducible from day one. I'd really appreciate any feedback on the paper, and if the project sounds interesting, I'd love to chat. Preprint and Github are in the comments. submitted by /u/BleedingXiko [link] [comments]
RT Sumanth: Open-source framework for building real-time voice AI agents! Pipecat is a Python framework for orchestrating audio, video, AI services, t...
RT Sumanth Open-source framework for building real-time voice AI agents! Pipecat is a Python framework for orchestrating audio, video, AI services, transports, and conversation pipelines. Voice-first architecture with pluggable components. What you can build: voice assistants, AI companions, multimodal interfaces, interactive storytelling, business agents (customer support, intake), and complex dialog systems. The framework handles speech recognition, text-to-speech, conversation logic, and real-time interaction. WebRTC and WebSocket transport built in. Ultra-low latency for natural conversations. Why Pipecat: • Voice-first: Integrates STT, TTS, and conversation handling in one framework • Pluggable: Supports multiple AI service providers for each capability • Composable pipelines: Build complex behavior from modular components • Real-time: Low-latency interaction with streaming audio/video Supported services: • Speech-to-Text: Deepgram, AssemblyAI, OpenAI Whisper, Groq, Azure, AWS, Google, and more • LLMs: OpenAI, Anthropic, Gemini, Groq, Mistral, Ollama, AWS, Azure, and more • Text-to-Speech: OpenAI, ElevenLabs, Deepgram, Cartesia, Azure, AWS, Google, and more • Speech-to-Speech: OpenAI Realtime, Gemini Multimodal Live, AWS Nova Sonic, Ultravox, Grok Voice Agent I've wrote a detailed tutorial on building a production customer support voice agent recently - covering turn detection, interruption handling, telephony codecs, and how to inject live business context into every call. I've quoted the article! Sumanth:
ECCV'26| 看起来会动,还要动得合理:从生成模型中主动寻找物理证据
新智元 2026-07-16 21:13 北京 新智元报道 【新智元导读】 PhyMAGIC通过让物体动起来,从视频中提取物理证据,帮助准确推断材料属性。它结合图生视频与视觉语言模型,生成针对性运动探针,并不断修正物理参数,最终构建出可微分的3D动态模型,实现更符合现实的视频生成。 给定一张篮球的图片,再输入一句「篮球落到地面后反弹」,现在的视频生成模型很快就能让画面动起来。 但仔细观察,问题也很明显:篮球可能在空中突然变形,落地后没有压缩,反弹高度与下落速度不匹配,甚至出现漂浮、穿透地面等现象。生成结果看起来像视频,却不一定符合真实世界的运动规律。原因在于,一张静态图片只能告诉我们物体「长什么样」,却很难直接告诉我们它有多重、多硬、是否容易发生塑性变形。 图1 用于物理属性识别的主动运动探测 密度、杨氏模量、泊松比和屈服应力等物理属性,通常需要通过运动和交互才能被观察到。 如图1所示,对于输入的黄色玩具小车,自由落体和爆炸所展示出的物理属性有很大差别,自由落体更能揭示质量、速度等;爆炸则更能揭示物体材料和密度。一个外观相似的物体,可能由橡胶、塑料、金属或沙粒组成。它们在自由下落、碰撞和挤压时会产生完全不同的响应。 针对这一问题,美国内华达大学里诺分校计算机科学与工程系和浙江大学软件学院的研究人员提出了一个无需额外训练的物理动态生成框架 PhyMAGIC, 不再要求视觉语言模型仅凭一张图片「猜」出全部物理参数,而是先生成一组有针对性的运动视频,将这些视频作为物理证据,再逐步修正对物体属性的判断。 论文链接: 开源代码: 方法介绍 PhyMAGIC的核心想法很直观: 如果静态图片中的信息不够,就让物体先动起来。 图2 PhyMAGIC的整体流程图 如图2,仅从一张Wolf-like的图片出发,很难准确判断它的质量和材料,但可以生成该运动物体自由下落、受到侧向推动或发生碰撞的视频。不同运动会暴露不同的物理线索: 自由下落和碰撞有助于判断质量、刚度与弹性; 挤压可以观察材料的形变和恢复能力; 旋转和侧推可以帮助分析惯性、接触方式和受力方向; 坍塌过程可以区分刚体、弹性体和颗粒材料。 PhyMAGIC中的图生视频模型并不是最终的物理模拟器,而更像一个「虚拟实验装置」。 它的作用是把静态图像中隐含的运动先验转化为可观察的时间线索。PhyMAGIC采用预训练的图生视频模型生成这些 Motion Probes,也就是运动探针视频。 随后,系统从视频中选取运动变化较明显的代表帧,交给视觉语言模型(VLMs)进行物理分析。某些运动可能适合判断质量,却不能充分揭示材料是否容易发生塑性变形。因此,PhyMAGIC为每个物理参数同时预测一个置信度。 视觉语言模型首先根据输入图片、文本指令和运动探针,估计物体的材料类型、质量、密度、杨氏模量、泊松比和屈服应力等属性。每个属性都会经过多次独立推断,并根据结果之间的一致性计算置信度。 对于不确定的物理属性,VLMs就继续针对这些物理属性进行提问。当某个参数的置信度低于阈值(gamma=0.6)时,系统不会直接接受当前结果,而是自动改写视频生成指令。例如,一个玩具模型的杨氏模量和泊松比仍然不确定,系统会把原来较宽泛的运动描述,改写成更能展现挤压、弯曲或回弹过程的指令。新的指令会再次驱动图生视频模型,生成更有针对性的运动证据。 随后,视觉语言模型重新分析视频并更新物理参数。这一过程形成了一个闭环: 发现低置信度参数 → 生成针对性运动 → 获取新的视频证据 → 重新推断物理属性。 实验过程 实验中,Motion probes最多进行三轮。随着证据不断增加,早期错误的材料分类和参数估计会逐渐得到修正。因此,PhyMAGIC不是要求模型一次给出确定答案,而是允许它先表达「不确定」,再主动寻找能够减少不确定性的证据。 推断出材料参数后,还需要解决另一个问题: 怎样让这些参数真正进入物理模拟器? 视觉语言模型通常输出「该物体是刚体,密度约为1200 kg/m³」这样的语义描述。但一个物理模拟器还需要知道初始速度、重力方向、边界条件、碰撞表面和外力配置。只有材料参数,没有运动条件,物体不会自动产生目标动作;只有「向左推」这样的指令,没有材料属性,不同材质也无法表现出合理差异。 为此,研究人员提出了 Hybrid Physical Parameters,简称HPP。它将两类信息组合成完整的物理配置: 一类是物体本身的材料属性,包括密度、杨氏模量、泊松比和屈服应力; 另一类是模拟器所需的执行参数,包括初始速度、外力、边界条件、接触模式和运动模板。 系统会根据文本指令和前面收集到的视频证据,在自由下落、挤压、旋转、反弹和侧推等运动模板中选择合适的配置。 接下来,PhyMAGIC使用TRELLIS将输入图片重建成3D Gaussian Splatting表示。每个高斯点不仅保存位置、颜色和透明度,也被赋予相应的物理属性,并作为材料粒子进入可微分的Material Point Method模拟器。最终得到的不只是一段二维视频,而是一个可以从不同视角渲染的动态3D对象。 结果分析 研究人员在PhysGaussian、PhysGen以及互联网收集的单图场景上进行了测试,覆盖刚体、弹性体和颗粒材料,以及自由下落、滚动、摆动、压缩和坍塌等运动。 如表1所示,在八组场景中,PhyMAGIC的平均CLIP相似度达到 0.251,高于OpenSora 2.0的0.233和CogVideoX的0.239,说明生成运动与文本描述之间具有更好的对应关系。 与PhysDreamer、Physics3D和OMNIPHYSGS等物理动态生成方法相比(表2),PhyMAGIC在六个代表场景上的平均CLIP相似度达到 0.252。Image-Motion-FID降低到 94.69,在对比方法中取得最佳结果。 研究人员还邀请61名参与者从物理合理性和文本一致性两个方面对生成结果进行评分。PhyMAGIC分别获得 3.00 和 3.07 的平均分,同样优于参与比较的视频生成模型。 迭代实验也显示,最初的推断可能将汽车错误判断为弹性材料,或严重低估篮球的密度和刚度。经过运动探针和置信度引导的修正后,三个代表场景中的参数准确率在第三轮均达到约90%或更高。 图5中的空间—时间切片与光流结果进一步表明,PhyMAGIC能够保持目标区域运动的连续性,同时减少背景和静止部件的意外形变。
VideoChat3:完全开放的视频多模态大语言模型,用于高效通用的视频理解
Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.
KeyFrame-Compass:走向关键帧条件视频生成的全面评估
Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.