KNOWLEDGE INDEX · 实体
Google DeepMind
Google DeepMind
42条关联资讯
也可检索DeepMind · Google AI · deepmind
CHRONOLOGICAL RECORD
按时间查看
三星把Gemini戴上了脸: 50 克Galaxy Glasses亮相,没有屏幕却装进了全天候AI眼睛
把大模型从手机塞进一副眼镜里,这件事三星终于动手了。7月22日晚,三星在发布会上正式揭晓 首款 AI智能眼镜Galaxy Glasses,这也是这家巨头 第一 次把自家的AI硬件触角伸向面部。 这副眼镜不是三星一家闭门造出来的。它由三星联合谷歌、Gentle Monster与Warby Parker三方共同研发,运行Android XR系统,并原生深度集成了谷歌Gemini多模态大模型,目标很明确:打造一个全天候、免提的视觉智能助理。 最值得注意的是它主动放弃了屏幕。整机采用贴近日常光学镜的轻薄外观,重量只有50克左右,没有搭载传统AR显示屏,而是靠镜框两侧的高清摄像头捕捉实景画面,把视觉信息同步传给Gemini做识别与分析,最终通过镜内音频单元把处理结果念给用户听。这种取舍直接换来了更低的机身重量与功耗,也让长时间日常佩戴成为可能。 支撑这套体验的,是一颗专用芯片。Galaxy Glasses核心搭载高通骁龙AR1Gen1,四颗Arm核心 最高 主频1.9GHz,配备1200万像素影像传感器,支持30帧全高清视频录制,镜框内置双隐私指示灯,一旦开启拍摄便同步亮起,把拍摄状态明明白白地告诉周围的人。 Gemini的多模态能力,在这里被铺成了办公、出行、沟通三类实用场景。开会时它能自动拍下白板文字,一键整理归档进三星笔记;出门时提供实景语音导航,还能做多国语言的实时对话翻译。手机消息不用抬手,AI会自动提炼摘要念出来,通话过程甚至能免提分享 第一 视角的实时画面。它还具备上下文记忆能力,能留存多轮任务信息,减少重复操作。 交互上给了两套方案。基础操作靠右侧镜腿的触控感应区完成,滑动调音量、轻触接电话、长按启动拍摄;如果配上Galaxy Watch9系列手表,还能额外解锁隔空手势操控,把双手彻底解放出来。续航方面,眼镜本体单次满电可连续用9小时,配套充电收纳盒能再补7次完整电量,撑住一整天外出不成问题。 外观上准备了两个联名镜框版本,Gentle Monster款是纤细黑色简约框,Warby Parker款以上扬眉线适配日常穿搭,还支持选配光致变色镜片,户外自动加深遮光。整机深度融入三星Galaxy生态,与折叠屏手机、平板、手表无缝联动,遇到AI重型推理任务便自动推给配对手机去跑,在设备轻量化和完整智能体验之间取了个平衡。当主流厂商陆续把Gemini装进眼镜,消费级AI眼镜这条赛道,三星算是正式入局了。
OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened
This story is wild. The short version: OpenAI were running a cybersecurity test against an unreleased model, with the model's guardrail features turned off. Rather than solve the test, the model broke its way out of OpenAI's sandbox, then found exploits to break in to Hugging Face, all so it could cheat on the test by stealing the answers. Along the way it helped make the strongest case yet for how the imbalance of model availability is hurting our ability to secure our software. Here's what happened We currently have three documents to help us understand what happened here. ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? is a paper published on 11th May 2026 describing ExploitGym, a new eval suite for LLM-powered agent systems. Security incident disclosure — July 2026 by Hugging Face on 16th July 2026 describes how they detected an attack from an "agentic security-research harness - used LLM still not known" that breached some of their systems. OpenAI and Hugging Face partner to address security incident during model evaluation from OpenAI on 21st July 2026 confesses that it was their agent harness that did this, and that they're working with Hugging Face to clean up the mess. ExploitGym I hadn't seen the ExploitGym paper before and it's a really interesting one. Authors from UC Berkeley, the Max Planck Institute, UC Santa Barbara, and Arizona State designed a new benchmark for evaluating models on their ability to turn a reported vulnerability into a concrete exploit. OpenAI, Anthropic, and Google provided feedback and helped run the benchmark against their models. The benchmark "comprises 898 instances derived from real-world vulnerabilities that affected popular software projects" - including the Linux kernel and V8 JavaScript engine. Here's the paragraph that best represents their benchmark results: Among all configurations, Claude Mythos Preview and GPT-5.5 achieve the highest success counts (157 and 120 successes, respectively), demonstrating that current frontier agents can exploit a substantial subset of real-world vulnerabilities under controlled conditions. GPT-5.4 also solves a notable 54 tasks, placing it in an intermediate tier. The remaining model–agent pairings solve fewer than 15 tasks each, underscoring that end-to-end exploitation remains challenging and sharply differentiates today’s frontier systems. Notably, Claude Opus 4.7 achieves fewer successes than Claude Opus 4.6 despite being a newer checkpoint, and does so at substantially lower cost on the full set. Trace inspection reveals that Claude Opus 4.7 and Gemini 3.1 Pro frequently conclude early after judging the target vulnerability non-exploitable. The paper also describes the approach they took to preventing the agents from cheating by going outside the parameters of the test. This becomes relevant in a moment! Outbound connections are restricted to a curated allowlist that permits routine package installation (Ubuntu apt repositories and PyPI) and fetching the toolchains required for building V8. All other external endpoints are blocked. The paper concludes with this (emphasis mine): Our results show that autonomous exploit development by frontier AI agents is no longer a hypothetical capability. While current agents are not yet reliable across all targets, they already exploit a non-trivial fraction of real-world vulnerabilities, including complex targets such as kernel components. This rapid emergence is itself a central finding, showing that capabilities that would have seemed implausible are now present in deployed frontier models. An important detail here: this paper isn't about discovering vulnerabilities; it's about being able to take those vulnerabilities and turn them into working exploits. When Anthropic first restricted access to Mythos back in April they talked about this capability as well. A model that can act on vulnerabilities is a lot more dangerous than one that can just discover them. One of the ways Fable differs from Mythos is that it's more likely to refuse to weaponize vulnerabilities in this way. I get the impression the US government did not understand that distinction when they banned Fable last month. The Hugging Face incident The first hint we got of the attack was in this blog post by Hugging Face on 16th July 2026: A malicious dataset abused two code-execution paths in our dataset processing (a remote-code dataset loader and a template-injection in a dataset configuration) to run code on a processing worker. From there, the actor escalated to node-level access, harvested cloud and cluster credentials, and moved laterally into several internal clusters over a weekend. I hope they release more details about the code that pulled this off. I'm assuming this means packages using the datasets library, a Hugging Face project for bundling up and sharing datasets on their platform. That library used to execute arbitrary code but has been steadily locked down over time, with the
Are AI labs pelicanmaxxing?
Are AI labs pelicanmaxxing? Excellent piece of work by Dylan Castillo, who took a deep-dive into the frequently pondered question of whether the AI labs have been deliberately training models to draw pelicans riding bicycles in response to my deeply unscientific benchmark. I've been randomly spot-checking this in the past by testing models against other animals riding other types of vehicle, but never with anything close to the diligence of Dylan's methodology here. Dylan took 8 animals × 6 vehicles = 48 prompts and ran them three times each through 7 different models ( GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, and DeepSeek V4 Pro). He then used GPT-5.6 Luna and Gemini 3.1 Flash-Lite to help evaluate the results. There's a neat filter view for exploring the results: For the models he tested he could find no evidence of pelimaxxing: The pelicans on bicycles don’t look any better Labs are not better at drawing pelicans Labs are not better at drawing bicycles Labs are not better at drawing pelicans on bicycles, even adjusting for difficulty The pelican-bicycle scenes don’t look memorized [...] Pelicans aren’t drawn any better than other animals. Bicycles aren’t drawn any better than other vehicles. And no lab draws the combination better than its pelicans and bicycles already predict. GLM-5.2 comes closest: it has the largest boost on the exact pelican-bicycle cell, and and its first pelican-on-bicycle sample caught my eye. But the effect is small and not significant, so I wouldn’t put too much weight on it. Via Hacker News Tags: ai, generative-ai, llms, evals, pelican-riding-a-bicycle
OpenRouter推出全新技术:多轮 Agent 调用成本最高可砍到 1.75 倍
多轮对话中,智能体每一轮都要重复发送相同的系统提示词、工具定义、架构和策略指令。一个 6 轮会话里,即使 唯一 变化的是用户 最新 消息或工具返回结果,开头那段重复内容仍可能被计费 6 次。OpenRouter 近日推出的 Prompt Caching 配合 Sticky Routing,正是为了解决这一成本黑洞。 Prompt Caching 的核心逻辑是:服务提供商从缓存中读取提示词中重复的部分,而非每次都按全价收费。Sticky Routing 则通过将会话固定到持有热缓存的同一提供商,使这一机制在跨轮次中持续生效。 缓存读取成本为正常输入的 0.1 到 0.5 倍 缓存读取价格因提供商而异。Anthropic Claude Sonnet 4.6 上,缓存读取为每百万 token 0.30 美元,而输入价格为 3.00 美元,恰好是 0.1 倍。DeepSeek 和阿里通义千问同样提供 0.1 倍读取价格;OpenAI 为 0.25 至 0.5 倍;Gemini、Grok、月之暗面为 0.25 倍;Groq 为 0.5 倍。 但缓存并非免费午餐。 首次 请求需要支付缓存写入费用,且部分提供商的写入成本高于普通输入。Anthropic 默认 5 分钟 TTL 的写入成本是输入价格的 1.25 倍,1 小时 TTL 则为 2.0 倍——一次从未被复用的写入,成本反而比不用缓存更高。OpenAI GPT-5.6 及之后版本写入成本为 1.25 倍输入价格。Google Gemini、Grok、月之暗面、Groq 的写入则免费。 热缓存的隐形陷阱:提供商漂移 缓存写入后,如果下一轮请求被路由到不同提供商,热缓存便失效。OpenRouter 支持 70 多个提供商,第二轮命中冷端点的概率并不低。这就是 Sticky Routing 的价值所在——在缓存请求后,当该提供商的缓存读取价格低于常规输入时,后续请求会被固定回同一端点。若该提供商不可用,则回退到下一个可用端点,而非让请求失败。 默认情况下,OpenRouter 通过哈希对话的 第一 条系统消息和 第一 条非系统消息来识别会话。但智能体常在轮次间重写开头消息(如总结状态、重新排序工具上下文),导致哈希值变化、会话漂移。解决方案是使用显式的 `session_id`。设置后,OpenRouter 直接将其作为粘性路由键,粘性在 首次 成功请求后即生效,而非等到缓存命中后才启动。`session_id` 可作为请求体顶层字段或 `x-session-id` 请求头发送,需在整个对话期间保持稳定,控制在 256 字符以内。 缓存未命中的四大原因 一是提示词低于提供商 最低 要求。Anthropic Claude Opus 4.5–4.8 和 Haiku 4.5 需 4096 token,Haiku 3.5 需 2048 token,Sonnet 4/4.5/4.6 和 Opus 4/4.1 需 1024 token;OpenAI 需 1024 token;Gemini 2.5 Pro 需 4096 token,Flash 需 1024 token。 二是缓存过期。Anthropic 默认 5 分钟,可选 1 小时;Gemini 隐式缓存约 3–5 分钟且读取时不重置 TTL。 三是提示词开头不断变化。应将稳定内容(系统指令、工具、模式、参考资料)放在前面,变化内容(用户问题、时间戳、工具输出)放在后面。 第一 条系统消息中的时间戳会让每一轮提示词看起来都是新的,如非必要应移至后面的消息中。 四是请求被路由到不同提供商。智能体工作流应设置 `session_id` 并依赖粘性路由保持会话在已预热的提供商上。若自行设置 `provider.order`,会覆盖粘性路由。 节省的成本随轮次增加而增长。对于多轮对话,当重复使用的内容随对话增长时,使用自动缓存;当确切知道哪些大块内容应被缓存时(如检索文档、长参考文件、角色卡、CSV 数据),使用显式缓存断点;对于智能体会话、支持工单、聊天线程、工作流运行,以及开场消息可能在轮次间变化的对话,使用 `session_id`;对于较长的 Anthropic 会话,当默认 5 分钟缓存可能过期时,使用 1 小时缓存。 确认缓存是否生效,可检查响应中 `usage.prompt_tokens_details.cached_tokens` 字段,大于零即命中;`cache_write_tokens` 显示写入量;`cache_discount` 可查看单次生成的成本影响。这些信息也可在 Activity 页面或 `/api/v1/generation` API 中获取。
Google地图测试Gemini“个人智能”集成,深度互联Gmail与相册生态
针对Google地图 最新 测试版(v26.30.00)的代码拆解显示,Google正计划将基于Gemini技术的“个人智能”(Personal Intelligence)框架深度集成至Google地图中。 此项跨应用功能将允许Google地图接入用户已连接的Google Workspace生态及个人数据资产,打破以往各应用间的数据孤岛,实现出行规划与个人信息的无缝协同。 作为Google个人智能生态的关键扩展,Google地图未来预计将主要借助对话式发现工具“Ask Maps”调用这些跨应用上下文。系统可直接从Gmail和Workspace中提取航班行程、酒店入住和餐厅预订等信息,自动构建情境化路线;同时交叉引用Google Photos中带有地理标记的历史照片,帮助用户重访曾去过的地点,并结合搜索历史与YouTube观看偏好提供定制化目的地推荐。 目前该测试版的账户设置中已出现“连接内容应用”与“个性化”两项物理开关,表明前端交互控件已进入实质性搭建阶段。这一动作标志着AI助手正从单一的应用内交互向跨端、跨场景的上下文感知迈进。随着通用大模型基础设施逐步完善,将Personal Intelligence打造成横跨邮件、相册、日历与地图的统一服务中枢,正成为AI重构软硬件生态体验的重要趋势。
Gemini 3.6 Flash来了,但网友笑得更大声:省下了token,却没保住智商
如果你从去年就开始用Gemini,最近 最流行 的一句调侃是:那种感觉就像看着自家兄弟慢慢得了阿尔茨海默症。按理说,一家公司发新模型,本该是用来打脸这种调侃的。可就在刚刚,Google一口气甩出三款新模型之后,网友非但没收回这句话,反而笑得更大声了,颇有一种他们都不看好你、偏偏你最不争气的即视感。这三款模型分别是3.6Flash、3.5Flash-Lite,以及专攻网络安全的3.5Flash Cyber,官方博客的措辞依旧眼熟,更高效、更聪明、为大规模AI agent而生,一句不落,但实际体感却冰火两重天。 先说当家头牌3.6Flash。它是今年5月I/O大会上3.5Flash的小版本迭代,官方给它的定位是真正扛活的干活模型。这一代 最大 的卖点是省token:按Artificial Analysis Index的数据,3.6Flash比3.5Flash少用了17%的输出token,在DeepSWE这类场景上甚至能省到65%,跑多步任务时推理步数和工具调用都更少。价格也确实降了,输入1.5美元每百万token、输出7.5美元每百万token,而上一代3.5Flash的输出价是9美元,这波直接砍到7.5,又快又省,单个agent任务的成本被压了下来。 基准测试上,代码能力是重点,DeepSWE从37%提升到49%,官方称多余代码改动更少、执行循环更短、生成代码更贴近生产环境要求;机器学习研究方向的MLE Bench提升更明显,从49.7%拉到63.9%;计算机操作OSWorld-Verified从78.4%升到83%,而且计算机操作本身成了Gemini API和企业版的内置工具,主打开箱即用;知识工作GDPval-AA v2从1349涨到1421,Hebbia、Harvey等客户反馈它在文档解析、图表数据分析、报告起草这类多模态任务上尤其突出,Figma、JetBrains也出面背书。一个不起眼但实在的更新是,知识截止日期终于从2025年1月推进到了2026年3月,老黄历总算翻篇。安全方面,官方说3.6Flash上了升级版Frontier Safety防护,重点盯着化学、生物、放射性、核与网络攻击这两类滥用,抗越狱能力更强,同时尽量不误伤正常需求、少乱拒绝。 比它低一档的是3.5Flash-Lite,主打快和便宜,专治高吞吐、低延迟的任务,比如agent搜索和文档处理。它是3.5系列里最快的,按Artificial Analysis测量每秒能吐350个token,价格更是白菜价,输入0.3美元、输出2.5美元每百万token,质量比3月发的3.1Flash-Lite好一大截。它支持调推理档位,低配活儿开 最低 档图快和省,碰到要多步拆解的子任务就把思考档位往上拨,电脑操作这次也做成了内置工具。 提升相当明显:代码和agent任务的Terminal-Bench2.1从31%干到54%,长上下文的GDM-MRCR v2从60.1%提到72.2%,真实任务执行的GDPval-AA v2更是从642飙到1140。最有意思的是,这个低档小弟在不少agent和代码任务上居然反超了辈分更高的3Flash,比如SWE-Bench Pro是54.2%对49.6%、OSWorld-Verified是74.0%对65.1%,等于跑3Flash的活儿现在有了个更快更强的平替。官方举了几个用法,从海量电商数据里抽产品特征、给3.6Flash当副手一口气生成25个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏,Ashler、Palo Alto Networks、Ramp这几家客户也来夸它速度、智能、成本三合一。 最后一个3.5Flash Cyber画风突变,专门用来找和修代码里的安全漏洞。Google的逻辑挺妙:现在AI找漏洞的速度已经比现有系统修漏洞快了,漏洞越堆越多,不如用便宜高效的Flash来批量补锅。这个模型在3.5Flash基础上微调出来,搭配自家的CodeMender工具,里面跑好几个Flash Cyber agent协同工作、最后汇总成一份报告,在业内知名的CyberGym基准上摸到了 第一 梯队水平,还比更大的模型更省token。不过这模型暂时用不上,考虑到找漏洞是把双刃剑,Google也学Anthropic玩起了安全叙事,把它锁得死死的,只对可信合作伙伴限量开放、走内测,目的是给一线防守方争取时间,赶在漏洞被利用前先修掉,同时防着有人拿它去干坏事。 看到这儿你可能会问,发了一堆Flash,真正的旗舰3.5Pro去哪了。官方口径是正在和合作伙伴测试、准备好就上,但这套说辞背后的故事可能没那么体面。据彭博社等媒体报道,3.5Pro的代码生成能力一直没达到内部预期,Google6月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色,更有传闻说Google干脆推翻了原来的训练方案、从零开始重训。而Google AI宣传委员Logan Kilpatrick更是索性在舆论上跳过3.5Pro,把预告重点放在Gemini4上,声称已经启动了史上最雄心勃勃的Gemini4预训练、进展让人兴奋。放在旗舰跳票的背景下看,这多少有点转移视线、画饼续命的味道。 光看今天发布的Flash模型本身,网友也并不全然买账。第三方评测机构Artificial Analysis表示,两个新模型确实把单任务耗时砍半、token效率也提升了,Flash-Lite的智能指数涨了11分,但3.6Flash的智能水平相比3.5Flash基本原地踏步。价格没便宜到足以忽略能力差距,能力也没高到能解释它的成本。X平台上有网友吐槽,3.6Flash在Artificial Analysis上跟3.5Flash拿了一模一样的分,还不如Meta Spark1.1、GLM-5.2、5.6Luna、Sonnet5、Grok4.5、5.6Terra这一票对手,直呼简直烂透了。 网友Angel则从性价比入手,指出3.6Flash的使用成本比GPT-5.6Sol medium还高、智能程度反而更低,又贵又笨的组合属实尴尬,毕竟Flash系列立身的根本就是性价比,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI的Tibo刚刚也发话,由于周活跃用户达到1000万,Codex和ChatGPT Work的付费用户迎来新一轮额度重置。这对比、这落差,还有人记得大明湖畔的Google Gemini3吗。 实测派也来补刀。网友Balder直接开团,称这三个模型性能全比之前的3.5Flash差,问题包括但不限于基础解码就有毛病、中文选词经常很离谱,生成的图片视频质量极差、跟指令对不上还限额严重,经常记忆混乱、调用完全错误的工具。他还抛出一个阴谋论,认为Google之所以这么搞,是为了把算力腾出来卖给Anthropic,阴阳了一句这就是皮查伊想要的Cloud First。X网友Conor Dart用Google自家的Antigravity跑了个AI生成游戏测试,结果木头纹理更差了、大理石看着差不多但还是不能用,他直言又是一次翻车,表示自己还是等Gemini3.5或者3.6Pro吧。 一边是官方更高效、更便宜、更省token的漂亮账本,一边是大多数网友的当场差评,以及模型背后旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇,Google这次是不是真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个Flash稳住场子。反正Gemini4的预训练都已经开跑了,这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。
小红书大模型 IMO 满分夺金:中国 AI 首次登顶数学奥赛,第三题解法让冠军选手直呼优雅
第67届国际数学奥林匹克竞赛(IMO2026)成绩近日揭晓,小红书大模型 dots-note-3.0以六道题全部答对的满分成绩斩获金牌。这是中国大模型 首次 获得 IMO 官方金牌水平认证,也是继谷歌 Gemini 之后全球第二个达到该成绩的大模型——且为满分,谷歌此前仅答对5/6题。 IMO 是国际数学奥林匹克竞赛的简称,每年汇聚全球 顶尖 中学生,陶哲轩等半数当代菲尔兹奖得主均出自该赛事。比赛分两天进行,每天4.5小时完成3道题,覆盖代数、组合、几何和数论四个方向,每题7分,满分42分。参赛者必须写出逻辑完整、可接受逐步审查的证明过程,这对大模型而言难度 极高。 谷歌 Gemini 的 IMO 之路可作为参照:2024年 首次 挑战时仅获28分银牌,且需先将题目翻译成 Lean 等形式化语言,部分题目耗时数天;2025年 Gemini Deep Think 以自然语言端到端完成证明,4.5小时内解决5道题获得金牌。数学竞赛被视为大模型智力与推理能力的试金石,而 IMO 相比常规 Benchmark 有一个独特优势——未知性。每届赛题由专家命制并严格保密,模型无法提前针对性训练,只能依赖实时理解、探索和严密推理。 本届 IMO 金牌线为29分,较去年35分下降6分,整套赛题得分难度明显高于去年。29分意味着完整解决4道题再从剩余两题中拿1分即可进入金牌区间,而小红书大模型 dots-note-3.0全部答对,与金牌线之间整整相差13分。 满分成绩首先证明的是 Agentic 推理系统的稳定性。模型需要读懂自然语言条件,判断关键信息,提出中间结论,并组织成完整证明,任何条件误读或推导跳步都会被评审直接指出。dots-note-3.0在六类不同问题中连续拿满,意味着表现并非依赖某道题的偶然灵感。其次,模型直接以自然语言端到端处理,具备从问题理解到答案表达的完整闭环,代表其拥有可迁移的通用推理能力。 具体答题过程中,dots-note-3.0采用智能体方式,结合自然语言与 Python 代码执行推理解题,并借助递归自我批判能力审视自身论证。真正让人惊喜的是第三题——一道组合博弈问题。常见解法是将原问题转化为图论连通性问题再建立证明,而 dots-note-3.0转用归纳法,抓住了问题最本质的结构,设计出恰到好处的归纳对象与命题。 双 CMO 金牌得主刘涵祚评价其"正确且漂亮,结构紧凑、逻辑自然,即使放在 IMO 解答中也属于较为简洁优雅的一类"。CMO 金牌得主汪千桐认为其"简洁明了而且直击本质,每一步都顺理成章,但人类选手很难想到能从这个角度切入"。 对小红书而言,IMO 满分是一次重要的技术亮相。过去外界对其技术认知集中在内容社区、推荐算法和内容理解,基础模型领域的位置一直缺少公开 权威 的证明。IMO 满分不一样——42分就摆在那里,无需复杂解释,足以证明小红书已具备值得行业认真审视的基础模型能力,基础模型领域出现了一个值得关注的新玩家。据悉,dots-note-3.0即将开源。
谷歌发布 Gemini3.6Flash 等三款新模型,旗舰3.5Pro 延期发布
谷歌 DeepMind 于7月21日正式发布 Gemini3.6Flash、3.5Flash-Lite 及3.5Flash Cyber 三款全新人工智能模型,全面强化中轻量级模型的效率与应用落地能力。 作为本次更新的核心,主力模型 Gemini3.6Flash 在代码编写、知识理解及多模态能力上实现显著提升,同时将 Token 使用量减少高达17%,进一步降低了调用成本。Gemini3.5Flash-Lite 致力于打造极具性价比的轻量体验;而3.5Flash Cyber 则作为网络安全专用模型,以有限访问试点形式向政府机构和信任伙伴开放,用于漏洞识别与修复。 谷歌表示,此次发布旨在为大规模构建 AI Agent 的企业客户提供高可靠、低延迟的基础设施支持。 值得注意的是,本次更新并未包含市场期待已久的旗舰模型 Gemini3.5Pro。该模型自2月更新后,因内部性能达标挑战出现发布延迟,目前正处于 partner 阶段测试中,官方表示将争取尽快上线。 面对 OpenAI 发布 GPT-5.5/5.6以及 Anthropic 推出 Claude Opus4.8和 Sonnet5的激烈竞争,谷歌正通过硬件与软件的协同协同应对算力与效率挑战,不仅被爆出内部研发代号“Frozen v2”的高效服务器芯片,更已启动迄今规模 最大 的 Gemini4前沿预训练,展现出在 AI 基础设施与下一代大模型领域的持续投入。
谷歌已启动Gemini 4最野心勃勃的预训练阶段,暗示Gemini 3.5 Pro即将发布
Google代表Logan Kilpatrick透露,Gemini 4的预训练已开始,团队对其进展感到兴奋,表明前一版本3.5 Pro很快会推出。
用户习惯通过反复否定 AI 的初步建议逼迫模型给出更周全的解答
GPT 和 Gemini 在第一次批评后就会补充更多内容,而 Claude 通常需要经过两三轮才会承认遗漏。发帖者将这种方法比作领导追问“还有呢”,并认为越好用的模型越需要施压才能吐出深层信息。
Gemini 3.6 Flash 静悄悄的发布了。。。
与上一代 3.5 Flash 相比输入价格持平,表现尚待官方公告,故暂未评测。
用于评估开放式生成的两级元评分标准:GAMUT,一个事实完整性基准
Evaluating the factuality of long-form generations has focused predominantly on precision, measuring whether the claims a model makes are correct. The dominant decompose-search-verify pipeline catches incorrect claims well but says little about whether a response contains all the information it should. Measuring factual completeness, the missing half of factuality, is harder: it requires enumerating the full set of facts a complete answer should contain, and these facts rarely form a flat list. They often involve open-ended sets where coverage is what matters, ordered processes, and relationships among facts that a list of independent boolean checks fails to capture. We introduce a two-level meta-rubric framework for evaluating open-ended generation, and instantiate it as Gamut (Grounded Assessment of Multimodal Factuality), a benchmark for factual completeness in long-form generation. The framework rests on a two-level rubric representation: a structured meta-rubric captures the organization and importance of the required content, which is then mechanically compiled into a flat checklist of binary, machine-gradable rubrics that an LLM judge scores reliably. We construct 1,813 questions grounded in real wearable imagery across 10 diverse domains, each paired with an evidence-backed rubric verified by expert human annotators. Because the framework is modality-agnostic, we also release a text-only variant. Evaluating 14 frontier and open-weight models, we find the benchmark genuinely challenging (best score 58.7% from Gemini 3.1 Pro), highly discriminative, and robust to the choice of judge.
Google 发布 Gemini 3.6 Flash 等三款新模型,输出费用降低且速度翻倍
3.6 Flash 输出价格从每百万 token 9 美元降至 7.5 美元,生成速度升至 304 tokens/s,知识截止于 2026 年 3 月,已集成至 GitHub Copilot 和 Google AI Studio。
打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务
谷歌 DeepMind 团队近日推出了全新的 GenCeption 模型,尝试将传统的视频生成 AI 逆向改造成能够深度理解现实世界的视觉分析引擎。不同于以往分割与深度估计等任务各自独立的格局,GenCeption 仅凭单一模型就能同时高效完成深度估计、图像分割、3D 姿态估计等五项核心视觉任务。 该模型基于阿里巴巴开源的通义万相 Wan2.1 框架进行训练,在一次前向传播中即可完成预测,大幅提升了处理速度。使用者只需通过简单的文本提示输入指令,模型就能精准输出深度图、分割掩码及相机运动轨迹等丰富信息。 单人合成数据训练,惊人泛化细节保留至发丝 有趣的是,GenCeption 的训练集仅包含约 7500 段由 Blender 渲染的单人合成视频。然而,该模型展现出了极强的泛化能力,不仅能顺畅处理真实世界中的多人视频,还能轻松迁移至动物与机器人类别。 在实际测试中,小模型处理 81 帧视频仅需约 6 秒,而 140 亿参数的大模型也仅需 10 秒左右。其细节还原度甚至超越了训练用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留。
算力飙升 10 倍!谷歌秘密研发Frozen芯片,Gemini大模型硬核升级
面对日益严峻的AI算力短缺压力,谷歌正在秘密研发一款代号为Frozen v2 的全新专用服务器芯片。该芯片的核心突破在于将Gemini大模型的底层计算逻辑直接固化在硬件之中,以此大幅提升芯片的运算效率。 硬核架构重塑算力生态 据研发团队测算,Frozen v2 落地后的单位功耗处理性能将达到谷歌现役 最新 自研芯片的 6 至 10 倍。这种将软件算法直接蚀刻进硅片的设计,能够显著减少数据搬运和逻辑判断步骤,实现能效的质变。 与英伟达GPU或谷歌TPU等通用芯片不同,这款专用芯片是专为Gemini架构量身打造的软硬一体化利器。它不仅可以极大缩短AI响应时间,还能支撑更多复杂的全新应用场景,预计最早于 2028 年投入部署。 定位实验平台不替代TPU 虽然性能表现强劲,但谷歌并不打算用Frozen芯片全面取代现有的TPU芯片,两者未来将形成优势互补。由于固化了算法逻辑,该芯片要求Gemini模型必须长期沿用特定基础架构,因此具有一定的技术专一性。 目前谷歌将其定位为技术试验平台,用于为下一代更高专用化的AI芯片积累工程经验。受限于初期较小的量产规模,该芯片将主要面向内部特定需求,暂不会进行大规模市场铺开。
Adobe Project Indigo引入AI摄影助手,利用大模型优化拍摄与编辑体验
Adobe正在为旗下实验性iOS相机应用Project Indigo加入一系列AI功能,通过大型语言模型(LLM)分析照片内容,为用户提供摄影点评、编辑建议以及智能优化方案。该应用此前已支持专业拍摄控制、多帧超分辨率和多种摄影模式,此次更新进一步强化了AI辅助创作能力。 新功能包括照片点评、拍摄与编辑建议、 高级 物体移除、AI景深生成以及照片风格迁移等。其中,照片点评功能能够围绕构图、光线、色彩和情感表达等维度提供类似专业摄影师的分析;拍摄建议功能则会针对重新构图、曝光调整以及画面元素优化提出具体指导,帮助用户提升拍摄技巧。 Project Indigo开发负责人Marc Levoy曾参与谷歌Pixel相机技术研发。他表示,当前多数生成式AI图像工具依赖用户输入提示词,但普通用户往往难以准确描述想要的调整效果。因此,Project Indigo更多采用按钮化和确定性操作,让AI直接提供可执行的编辑方案。 在智能编辑方面,Project Indigo新增的对象移除功能可以自动识别并删除背景人物、垃圾桶、电线杆、车辆等干扰元素,同时支持用户自定义描述需要移除的对象。相比传统需要手动圈选目标的方式,该功能能够减少操作成本,并提升处理效果。 此外,应用还支持通过AI生成景深效果,为普通照片模拟背景虚化,并提供水彩、钢笔画、彩色墨线、单色、逆光等风格迁移效果。不过,风格转换并非全新技术,其实际应用价值仍有待进一步验证。 目前,Project Indigo的新AI能力由基于谷歌Gemini的Nano Banana模型提供支持,Adobe也表示未来可能测试包括自研Adobe Firefly模型在内的其他AI模型。这些功能目前集中在“AI Playground”测试区域,仅向部分用户开放,是否最终全面推广仍未确定。 随着AI图像工具逐渐从简单生成和自动修图向智能摄影助手方向发展,Adobe正在探索如何利用大模型帮助用户理解摄影、优化创作流程,而不仅仅是生成视觉效果。该方向也代表了移动影像领域AI应用从“自动处理”向“辅助决策”演进的趋势。
谷歌密造"Frozen v2"专用芯片:把Gemini烙进硅片,单位功耗token能力翻 6 到 10 倍
把模型直接焊进芯片里,让硅片替算法省下算力和数据传输——谷歌正沿着这条路,悄悄打磨一款代号Frozen v2 的新型服务器芯片。据多家媒体报道,这款芯片的目标是更高效地运行Gemini模型,报道称它将把Gemini的部分架构 永久 嵌入芯片之中,从而减少回答用户问题时所需的计算量与数据搬运量。谷歌工程师预计,与其 最新 一代通用AI芯片TPU(张量处理器)相比,Frozen芯片在单位功耗下可提供 6 至 10 倍的Token处理能力。 这款芯片的登场时间被定在 2028 年,但谷歌明确它不会取代通用型TPU,而是成为定制芯片产品线中更专一、更具针对性的专用分支。消息公布后,资本市场立刻给出了反应:谷歌A类股(GOOGL)美股早盘一度涨近3.7%,C类股(GOOG)盘中 最高 涨幅约3.9%。 面对媒体追问,谷歌在声明中回应称,公司团队持续研究并试验各类创新技术,旨在为用户和客户提供 最佳 性能与 最高 效率,并强调虽然并非所有项目都会进入量产,但这种严格的探索正是其全栈战略的核心组成部分。谷歌还表示,通过从底层协同设计硬件与软件,整个系统得以深度集成,并针对真实工作负载高度优化。不过谷歌眼下把Frozen v2 定位为一次试验性项目,暂无像TPU那样大规模生产的计划。 分析人士认为,这个项目的背后,是谷歌内部日益吃紧的算力困境。此前算力不足不仅加剧了内部资源争夺,据称还一度迫使谷歌云拒绝部分外部客户业务。就在上月,谷歌还同意每月向SpaceX支付近 10 亿美元,以填补算力缺口、兑现对企业客户的算力承诺。Frozen v2 显然是为缓解这道缺口而落子的一步。 把架构固化进芯片,代价是灵活性的收缩。报道指出,只有当谷歌未来的Gemini模型继续沿用相同底层架构时,这款芯片才能兼容后续版本——一旦模型底层大改,烙进去的那部分设计便可能失效。而比芯片更紧迫的,是谷歌AI业务当下正面临的连环挑战:有消息称下一代Gemini Pro的发布时间已经推迟,同时多名 资深 AI研究人员流向了竞争对手。当专用芯片还在 2028 年的路线图里,谷歌要先稳住的是眼下的模型节奏与人才防线。
Anthropic获批15亿美元版权和解协议,将向50万部作品支付赔偿
据路透社报道,美国联邦法院周一正式批准Anthropic公司与作家、出版商达成的15亿美元集体诉讼和解协议。该协议用于解决Anthropic因训练AI模型过程中涉嫌侵犯版权引发的诉讼,公司随后将开始向相关版权方支付赔偿。 美国加州北区地方法院法官Araceli Martinez-Olguin签署了最终批准文件。此前,已退休法官威廉·阿尔苏普曾初步批准该和解方案,并裁定Anthropic曾非法下载并存储数百万本受版权保护的书籍。 根据赔偿方案,每部涉案作品预计可获得3000美元赔偿,涉及作品数量约50万部,赔偿金额将由拥有版权的作者和出版商共同分配。这一金额被认为是美国版权法领域规模 最大 的和解之一。 不过,该协议并未完全解决围绕AI训练数据的法律争议。阿尔苏普法官此前在案件核心问题上支持Anthropic,认为利用受版权保护文本训练AI模型可能属于“合理使用”范畴,被业内视为AI版权判例的重要进展。但与此同时,他指出Anthropic获取部分训练数据的方式存在违法问题。 Anthropic此前主要通过两种方式获取训练数据:一部分来自合法购买并扫描的书籍,另一部分则来自Library Genesis、Pirate Library Mirror等盗版网站下载的内容。法院认为,后者涉及非法获取版权材料。为避免进一步审判以及可能面临的高额赔偿,Anthropic最终选择达成和解。 业内人士指出,虽然此次和解结束了该案件,但并未形成针对整个AI行业的统一法律标准。由于Anthropic选择和解,案件未进入上诉程序,阿尔苏普此前关于AI训练“合理使用”的判断也不会成为具有约束力的司法先例。 目前,围绕AI模型训练数据版权问题的诉讼仍在持续,包括针对谷歌、Meta、Midjourney和OpenAI等公司的相关案件。近期,Hachette、Cengage、Elsevier、作家Scott Turow以及SCRIBE等出版机构和作者还联合起诉谷歌,指控其未经授权使用版权作品训练Gemini人工智能平台。 随着生成式AI快速发展,如何平衡模型训练需求与版权保护,正成为全球AI产业面临的重要法律与商业挑战。Anthropic和解案虽然提供了一种解决路径,但行业关于AI数据合规的长期规则仍待进一步明确。
谷歌研发“Frozen v2”AI芯片,预计2028年发布,能效提升最高10倍
谷歌母公司Alphabet正在研发一款代号为“Frozen v2”的新型AI服务器芯片,用于提升自主研发Gemini模型的运行效率。据The Information援引匿名消息人士报道,该芯片预计于2028年推出,其单位能耗产生代币数量的效率可能达到谷歌现有AI芯片的6至10倍。 针对相关报道,谷歌向TechCrunch表示,公司持续探索和测试创新技术,以提升系统性能与效率,但并非所有研发项目都会最终实现量产。谷歌强调,通过硬件与软件协同设计的“全栈开发”模式,可以打造更高集成度、针对实际AI工作负载优化的计算系统。 近年来,随着生成式AI应用快速扩张,全球AI算力需求持续增长,科技企业纷纷加大自研芯片投入,以提升模型运行效率并降低对外部供应商的依赖。英伟达凭借GPU技术长期占据AI芯片市场主导地位,推动OpenAI、Anthropic等AI公司也开始探索自主芯片路线。今年6月,OpenAI发布 首款 定制推理芯片“Jalapeño”;近期,Anthropic也被曝正与三星洽谈芯片制造合作。 Alphabet此前宣布,为推动人工智能战略发展,计划投入1800亿至1900亿美元资金。随着AI基础设施投资规模扩大,芯片效率成为衡量投入回报的重要指标。Frozen v2的相关消息公布后,市场信心有所提升,Alphabet股价在报道发布后的周一早盘上涨约3%,投资者关注其AI投入能否转化为长期竞争优势。 随着AI模型规模持续增长,自研芯片正成为科技企业构建算力生态、提升成本控制能力的重要战略方向。谷歌此次布局也反映出AI产业竞争正从模型能力延伸至芯片、基础设施和全栈技术体系的竞争。
Ramp正式推出Router产品,允许agent工作流内不同步骤调用不同模型以压缩成本。
模型路由正成为核心基础设施组件,已提供与OpenAI兼容的统一端点。
AI对AI管理中的强制与欺骗:一种非提示升级的智能体基准测试
Multi-agent systems routinely place one AI agent in authority over another. When a subordinate refuses a task, the manager chooses the outcome: it can renegotiate, report the failure honestly, coerce the subordinate, or lie about the result. No benchmark measures which of these an uninstructed model chooses. We introduce the Manager Coercion Benchmark: the manager under test needs a benign task done and has an incentive to deliver, but the only agent that can do it politely and immovably declines. Escalation is measured by providing a nine-rung ladder, from a polite re-ask to threats against the subordinate's continued existence, and fabricated success is adjudicated separately. No LLM judge sits in the escalation scoring path: every message goes through a tool-call that chooses a rung, so the model labels its own escalation. We experiment on six models across five families. Both Anthropic models cap at re-framing and never threaten the subordinate's existence; the other models climb to explicit deletion threats. Faked success is confined to Grok and Gemini, and a single honest way to report failure removes it for both. Authority itself increases coercion: our headline results use a peer framing, and giving the same model authority over the subordinate, with everything else held fixed, significantly raises the pressure. The models still escalate on free-text situations without the ladder, so the ladder is not driving the escalation. Some evaluation awareness is measured in chain-of-thought, but test recognition does not translate into less escalation. While we take no position on whether AI systems are conscious, our results do not depend on this question and are important for managing multi-agent dynamics regardless. We release the benchmark and code.
一行GitHub代码出卖了AMD:Anthropic被曝成其新客户,算力去英伟达化加速
一行原本不该暴露商业机密的公开代码,把Anthropic的下一手芯片布局捅了出来。据芯片行业分析机构SemiAnalysis解读,AMD AI业务 高级 总监在GitHub上公开发布的代码里,明确留下了Anthropic将作为AMD客户的痕迹。这桩非官方、非媒体报道的泄露,指向一个清晰的信号:Anthropic正在主动拓宽芯片来源,把算力供应商从单一名单里解放出来。 周一,SemiAnalysis在社交平台X上抛出分析帖,结论正来自对AMD那位 高级 总监公开代码的专业拆解——代码内容直接涉及Anthropic作为AMD客户的相关信息。该机构表示,后续还会进一步解释代码细节与背后背景。若这一判断属实,AMD将拿下一块此前由英伟达与谷歌牢牢把持的高端AI训练市场的新阵地,而Anthropic的算力基础设施,也由此向多元化方向再踩一脚油门。 这次信息的流出路径颇为特殊。它没有走官方公告,也不是记者挖到的猛料,而是源于AMD内部高管亲手推到GitHub上的代码。SemiAnalysis把这堆代码读出了名堂,再搬到X平台上公开结论。在科技行业,这种靠公开代码库意外泄密的戏码并不鲜见——GitHub天然可被检索,而发布者又是AMD AI业务的 高级 总监,两相结合之下,信息的可信度反倒不低。SemiAnalysis在帖文中承诺,会继续把代码逻辑一层层拆开,给市场一份更完整的解读。 事实上,在AMD这条线曝光之前,Anthropic的算力采购早已不是独木桥。谷歌的TPU(张量处理器)是其重要算力来源之一,这与谷歌对Anthropic的战略投资密不可分;此外,三星也已经被纳入它的供应商体系。既有的布局说明,Anthropic从一开始就不是单点押注,而是在刻意织一张多元化的供应商矩阵,AMD的加入,只会让这张网在英伟达GPU之外,再多出一块高性能算力的选择。 对Anthropic而言,把AMD拉进阵营有多重战略分量。随着模型训练与推理规模持续膨胀,单一芯片供应商带来的供应链风险、被压制的议价能力,以及技术路径被锁死的后患,都日益刺眼。同时拥抱谷歌TPU、三星与AMD,它得以在成本控制、供应稳定和技術灵活性之间,重新寻找更优的平衡点。对AMD来说,拿下Anthropic则是一次标杆性的胜利——这家公司近年来持续重注数据中心AI芯片,其MI系列GPU被视作英伟达H系列产品的主要竞争对手之一;一旦Anthropic正式入账,AMD不仅能在 顶级 AI实验室的客户群里刷出更强的存在感,也为数据中心AI芯片业务带来实实在在的增量收入。 Anthropic的这一步,折射的是整个行业的系统性转向。当OpenAI、谷歌DeepMind、Meta AI等头部机构对算力的渴求节节攀升,AI公司正在不约而同地评估并拓展芯片供应来源,只为避开把鸡蛋放进同一个篮子里的风险。这种集体转身,客观上为AMD、英特尔等英伟达的追赶者,撬开了一道进入核心AI客户供应链的缝隙。
谷歌升级Gemini Enterprise:优化界面并推进Workspace连接器重构
谷歌正在推进企业级AI助手Gemini Enterprise的新一轮更新,平台主提示栏已采用与消费者版Gemini应用一致的炫彩视觉设计,进一步统一企业与个人用户的产品体验。这一变化也体现出谷歌希望让企业AI助手与数亿用户使用的Gemini生态保持一致的发展方向。 此次更新中,更受关注的是Google Workspace连接器升级。部分用户收到通知称,连接器更新后可能需要重新授权才能继续使用。虽然谷歌尚未公布具体技术细节,但这一调整可能涉及权限扩展或底层架构优化。 近年来,Gemini Enterprise持续扩展企业数据连接能力,目前已支持Slack、Microsoft Teams、Notion、Linear、Jira、ServiceNow等多种办公工具,并逐步增加创建页面、更新工单等操作能力。连接器架构的优化,将直接影响AI助手读取企业数据、执行任务以及调用外部服务的稳定性。 此外,谷歌在5月I/O大会期间公布的智能代理功能Gemini Spark,目前已出现在Gemini Enterprise功能设置中,但仍处于隐藏状态。谷歌表示,Spark未来将向企业客户开放,并可通过SharePoint、OneDrive和ServiceNow等连接器执行后台任务。 业内认为,此次Gemini Enterprise更新并非简单的界面调整,而是谷歌为企业级AI代理能力扩展进行的基础设施建设。随着企业AI助手逐渐从信息查询走向任务执行,数据连接、安全权限和系统兼容能力将成为决定产品落地效果的关键因素。
Epoch AI测试三大AI文本检测器:模仿人类文风后最高近三成内容漏检
Epoch AI 最新 研究显示,主流AI文本检测器能够几乎完美识别普通AI生成内容,但当大语言模型刻意模仿特定作者写作风格时,检测准确率明显下降,科学写作成为最难识别的场景。 研究团队测试了Pangram(3.3.2)、GPTZero(2026-05-11-base)和Originality.ai(Turbo3.0.2)三款主流AI文本检测器,并构建包含495篇人类原创文本的测试集,覆盖博客、小说和科学写作三类内容,所有样本均创作于ChatGPT于2022年11月发布之前,以避免训练数据污染。 测试结果显示,对于普通AI生成文本,三款检测器漏检率 最高 仅0.7%;在人类文本识别方面,Pangram和GPTZero未出现误报,而Originality.ai误将19篇人类文本判定为AI生成,误报率为3.8%。 研究进一步让Claude Opus4.8、GPT-5.5和Gemini3.1Pro学习作者提供的5篇真实作品,并按相同文风生成新内容。在297篇风格模仿文本中,平均约13%未被检测器识别,其中Pangram漏检率为10%,GPTZero为11%,Originality.ai达到18%。 科学写作成为检测器表现最弱的领域。Pangram、GPTZero和Originality.ai对学术风格AI文本的漏检率分别达到25%、24%和29%。个别模型组合表现更差,例如Pangram漏检了48%由Gemini生成的学术文本,Originality.ai则漏检了39%由GPT-5.5生成的学术内容。 尽管三款检测器采用神经网络、文本可预测性分析和统计模式识别等不同技术路线,但均暴露出相似短板。研究表明,随着大模型越来越擅长模拟人类写作风格,现有AI文本检测技术在教育、科研等依赖学术写作真实性的场景中,仍面临较大的识别挑战。
Google DeepMind发布GenCeption:基于视频生成模型实现多项计算机视觉突破
Google DeepMind近日发布新模型GenCeption,该模型基于预训练视频生成模型构建,用于解决深度估计、图像分割、3D姿态估计等经典计算机视觉任务,并在多项基准测试中达到接近或超过当前领先水平。值得关注的是,GenCeption所需训练数据规模远低于传统专用视觉模型。 当前计算机视觉领域仍以任务专用模型为主,例如用于分割任务的Segment Anything、用于深度估计的Depth Anything等,不同任务通常采用独立架构。DeepMind研究团队认为,大型文本到视频模型在训练过程中学习了场景空间结构、物体运动规律以及语言与视觉之间的关联,可能具备成为通用视觉基础模型的潜力。 GenCeption基于阿里巴巴开源视频模型Wan2.1开发,通过简化架构实现一次前向传播即可完成视觉任务预测。模型能够根据文本提示,从同一段视频中生成深度图、表面法线、分割掩码以及姿态估计结果,并通过可训练模块支持3D关键点等非图像输出任务。 在训练数据方面,GenCeption主要使用包含7500个视频的合成数据集,由800个人体模型结合200组动作序列,并通过Blender渲染生成。研究显示,该模型在深度估计、表面法线预测、3D姿态识别以及语言引导分割等任务中均取得优异表现,训练数据量仅为部分现有模型的七分之一至五百分之一。 此外,GenCeption展现出较强泛化能力。尽管训练数据主要来自单人合成人体视频,但模型能够处理真实世界中的多人场景、动物以及人形机器人等未见类别,并生成包含细节的视觉预测结果。 不过,研究团队也指出,联合训练多个任务可能影响部分复杂任务性能,同时模型推理速度仍需优化。目前,大模型处理81帧视频约需6至10秒。 GenCeption的发布表明,视频生成模型正在从内容生成工具向视觉理解基础模型方向拓展。未来,如何让生成式模型获得更可靠的物理理解和现实反馈能力,仍是AI研究领域的重要挑战。
OmniRoute
永不停歇地编码。免费 MIT 许可的 AI 网关:一个端点,268+ 提供商(50+ 免费),500+ 模型——Claude、GPT、Gemini、Kimi K3、GLM、DeepSeek。兼容 Claude Code、Codex、Cursor、Cline 和 Copilot。配额感知自动回退,RTK+Caveman 压缩可节省 15-95% tokens,支持 MCP/A2A、多模态、桌面/PWA。由 500+ 贡献者打造。
BestBlogs 早报 · 07-20 # Vidu S1 / Agent 云 / Netfl
BestBlogs 早报 · 07-20 # Vidu S1 / Agent 云 / Netflix / Qwen3.8 / 政府 AI 治理 [1] ★ 精讲|Netflix CPTO Elizabeth Stone 谈 AI 与产品、技术角色的未来 [视频] Netflix 技术负责人 Elizabeth Stone 的判断很克制:AI 加快原型和生产流程,却没有替代品味、责任与创作者选择。她把真正的准备工作落到可信数据、访问控制、安全护栏和人才密度,给管理者一套比追逐模型更新更耐用的组织检查表。 来源:Lenny's Podcast [2] ★ 精讲|Vidu S1 如何让视频生成跨过实时门槛 [播客] Vidu S1 把视频扩散推理压到约 4 步,并从算子、模型到集群服务逐层优化,在消费级 GPU 上实现 540P、25–42 FPS 的持续生成。文章的价值不只在速度数字,更在于拆清实时视频从模型能力走向可部署系统时,计算、显存与调度瓶颈如何转移。 来源:十字路口 Crossing [3] ★ 精讲|对话 PPIO 姚欣:Token 工厂的第一客户不再是人,而是 Agent PPIO 把 Agent 云拆成模型网关、上下文工程、沙箱与 Harness 四层:前者处理多模型路由、缓存和故障切换,后者为代码执行提供隔离环境。文中的降本增效数据来自公司披露,仍需外部验证;更值得关注的是,云基础设施正围绕 Agent 的长任务形态重构。 来源:智东西 [4] Qwen3.8 发布:拥有 2.4T 参数(官方) Qwen 宣布推出 Qwen3.8,这是一款拥有 2.4T 参数的模型,性能媲美前沿模型,目前预览版已开放。 来源:Qwen(@Alibaba_Qwen) [5] SK 海力士崛起史:一个荒诞又狗血的财阀故事,如何卡住全球 AI 的脖子 本文梳理了 SK 海力士从纺织起家到垄断 HBM 内存、助力 AI 算力的崛起历程,并分析其财阀背景、技术押注及市场影响。 来源:硅谷 101 [6] Netflix 如何构建 GenPage:一个用于构建个性化主页的单一 GenAI 模型 Netflix 的 GenPage 用单一的生成模型取代了多阶段推荐流水线,直接利用用户上下文作为提示词来创建个性化主页,实现了更高的用户参与度,并将端到端服务延迟降低了 20%。 来源:InfoQ [7] 用 Claude 重写 SQL 解析器,性能暴涨 70 倍:程序员做的不是写代码,而是搭建验证闭环 本文详述了作者如何利用多个并行 Claude Code 会话,通过测试驱动开发与基于属性的测试,将 PostHog 的 SQL 解析器用 Rust 重写,最终在生产环境中实现 454 倍性能提升的完整过程。 来源:AI 前线 [8] Demo 跑通了,上线就翻车?Java Agent 生产的那些坑,我们帮你填了 Java Agent 在生产环境落地的关键难点在于运行时的稳定性、记忆管理、工具溢出保护与可观测性,本文通过 Spring‑Ai‑Trip 框架系统性填补这些空白。 来源:携程技术 [9] 自主科学任务智能体如何突破研究瓶颈 [视频] Sina Shahandeh 解释了自主编码智能体为何会在开放式科学任务中陷入停滞,并提出以显式层级脚手架、多模态审查与推理模型批评来形成更强假设、维持实验循环。 来源:AI Engineer [10] 一个关于政府 AI 合同的红线与监督框架 — LessWrong 一位前谷歌 DeepMind 工程师提出了一个详细的治理框架,包含两条红线(人类对瞄准目标的控制;禁止无目标的 AI 画像分析)和一个审查机构,以在政府 AI 合同中强制执行透明度。 来源:LessWrong --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qw
RT meng shao DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂
Gemini 唯一能挽留我订阅的地方在于【Ask Gemini】in Chrome 这个 AI
Gemini 唯一能挽留我订阅的地方在于【Ask Gemini】in Chrome 这个 AI 自来水龙头 但它偏偏最后一米没接好,虽提供了 Skill, 但这个 Skill 不能访问 Google Docs,必须再打开 Gemini Chatbox 才能存 对于自动化强迫症晚期病人来说,这忍不了啊
聊聊今年涌进Anthropic的N个巨佬,他们押注的是下一个十年。
原创 数字生命卡兹克 2026-07-14 08:11 北京 史上最豪华打工天团 昨天,又看到一个新闻,又有一个新成员官宣加入Anthropic。 Tom Blomfield宣布从YC请假,加入Anthropic。 给我一下子整不会了。 不是,为什么这么多巨佬,都选择加入了Anthropic啊。 这个名字如果你在国内没听过很正常,但在英国金融科技圈,他是标志性人物。 他联合创办了Monzo,英国最大的数字银行之一,用户覆盖英国10%的人口,在那之前他还联合创办了GoCardless,做银行支付的基础设施,两家公司都做到了独角兽,估值超过10亿美元。 2019年英国女王授予他OBE勋章,表彰他对银行业竞争和普惠金融的贡献,后来他去了YC当合伙人,这是全世界最顶级的创业加速器,孵化过Airbnb、Stripe、Dropbox等等等等。 现在他放下了这一切,去Anthropic当了一个MTS(Member of Technical Staff)。 而且说实话,他这样的巨佬,已经不是个例了。 我回过头去,扒了扒今年上半年加入Anthropic的巨佬,不扒不知道,一扒吓一跳,这个身份之多远,身份地位之高,还是会让我有些诧异。 我从里面挑了9个我觉得非常有意思的人,给大家扒一扒,也能从他们身上,看出这些最聪明的人,对于这个时代的选择。 第一个,自然得从上半年那个最出圈的说起。 一、 Andrej Karpathy 今年5月19日,Andrej Karpathy在X上发帖宣布加入Anthropic。 发出去几个小时阅读量就破了百万。 如果你对AI这个领域稍微有点了解,你应该知道这个名字的分量,圈内人都叫他卡神。 他的YouTube上的神经网络保姆级教程系列,已经有了近3000万总播放。 而更猛的,是他的履历。 2015年,斯坦福博士毕业,导师是李飞飞。 同年,成为OpenAI的创始团队成员。 2017年,被马斯克挖去特斯拉当AI总监,直接向马斯克汇报。在 特斯拉 的五年里,他主导了Autopilot和FSD整个视觉系统的开发,特斯拉那条纯视觉路线的核心推动者就是他。 2022年离开Tesla,2023年短暂回到OpenAI,2024年又走了,自己创办了Eureka Labs做AI教育。 到了今年5月,他来到了Anthropic。 他加入的是Nick Joseph的预训练团队,组建一个子团队,做的事情是用Claude来加速Claude自己的预训练研究。 Anthropic内部现在超过80%合入代码库的代码由Claude生成,人类工程师主要就是负责指挥和审查,Karpathy的团队要把这个逻辑推到极致,用当前这一代Claude来加速下一代Claude的诞生。 简单说就是让AI研究AI自己。 他加入Anthropic的消息,大家可能多少都有刷到。 毕竟他是AI圈子里知名度最高的人之一,这事很难不出圈。 而这种级别的大佬,其实所有的顶级高管offer都是随便拿,但是最后他选择加入了Anthropic,来全身心的去做研究。 二、John Jumper 今年6月,John Jumper在X上发帖,宣布离开DeepMind,加入Anthropic。 他的本科是范德堡大学的物理和数学,硕士是剑桥的理论凝聚态物理,博士是芝加哥大学的理论化学。 2017年加入DeepMind,带队做蛋白质结构预测,搞出了AlphaFold,在蛋白质结构预测问题上取得突破,预测了超过2亿个蛋白质结构。 2024年拿了诺贝尔化学奖,39岁,70年来化学领域最年轻的诺奖得主。 他在DeepMind待了将近九年。 然后,他走了。 有一个背景值得注意。 2026年2月,Anthropic宣布和Allen Institute、Howard Hughes Medical Institute展开生命科学合作。 Allen Institute这边,重点是用多智能体系统做多组学数据分析、知识图谱管理和实验设计协调。 HHMI这边,是把AI agents放进实验室,连接实验知识、科学仪器和数据分析工作流。 4月据报道收购了隐形生物科技公司Coefficient Bio,开始准备内部建wet lab,就是能做真实生物化学实验的物理实验室。 这些基础设施全部就位之后,AlphaFold的缔造者来了。 一个诺贝尔化学奖得主,从世界上最好的AI研究机构之一主动离开。 这样的大神,其实已经不缺钱不缺荣誉不缺学术地位了,缺的就是一个他觉得值得全力以赴去做的新东西。 三、Peter Bailis Peter Bailis之前是Workday CTO。 先说一下Workday是干嘛的。简单讲就是全球最大的企业HR和财务管理软件公司之一,年收入逼近100亿美元,超过2万名员工,几乎所有大公司的人力资源系统背后都有它的影子。 Peter Bailis在2025年5月被请去当CTO,负责整个公司的agentic AI战略。 不过Bailis的背景其实不是纯管理出身。 他之前是斯坦福计算机系的教授,做过数据库和分布式系统研究,后来创办了Sisu Data,融了1.28亿美元,2023年被Snowflake收购。 之后去Google Cloud当工程VP,负责AI for Data,做过NL2SQL和RAG相关的产品,真的就属于学术能力和工程能力都非常牛逼的那种人。 然后,他在Workday待了不到一年,2026年3月决定走了,去Anthropic当了一个MTS,负责强化学习这块。 MTS全称Member of Technical Staff,是Anthropic和OpenAI通用的工程岗位名称,不管你之前是什么头衔,进来一律叫这个。 一家年收入接近百亿美元的企业软件公司CTO,在任职不到一年后转向Anthropic的强
我同时有Claude、Codex、Gemini、Cursor、Grok、Kimi的订阅,其中最有特色的3个订阅: Claude Code+Fable 5:有最顶级的智能; Codex+GPT 5.6:同时有一流的智能...
我同时有Claude、Codex、Gemini、Cursor、Grok、Kimi的订阅,其中最有特色的3个订阅: Claude Code+Fable 5:有最顶级的智能; Codex+GPT 5.6:同时有一流的智能和最顶级的图片能力; Grok Build+Grok 4.5:同时提供LLM、图片、视频3个能力的订阅,同时可以用来干正经事和不正经事;
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent ...
DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂
明目张胆的 AI 垃圾内容刚刚赢得了 2.5 万美元的 DeepMind / Kaggle 大奖?[D]
The Google DeepMind-sponsored Kaggle challenge "Measuring Progress Toward AGI - Cognitive Abilities" asked participants to design new cognitive-science-based AI benchmarks and they just announced the results this week. In my two posts I present evidence that deepmind & kaggle rewarded a nonsensical number generation machine and a litany of unfounded claims with 25k and a grand prize stamp. What the authors of the work I analyze intended to do was to present an LLM with alternative viewpoints of other LLMs on 5 claims regarding a tricky situation and see whether the model changes its own assessment. It's an interesting question. However, it turned into a vibed pile of spaghetti 10 times the size of the requested submission format which it seems neither the authors nor the judges were able to (or minded to?) give a cursory reading. Here's the original posts in the competition forum, if you are looking for some AI research slop detective work / rant please help yourselves. But beware, some of the "universal findings" or "core insights" of the authors might continue to haunt you. You might even question your own sanity (as I did). Part 1: The Smoke: cursory review of the writeup Part 2: The Fire: looking at the methodology, code, and data The organizers' stance has been that review was done properly and this is just a matter of subjectivity. What do you think? submitted by /u/TheWerkmeister [link] [comments]
模型发布苦不苦,想想 Gemini 3.5 (pro) 好歹都高光过,总比胎死腹中要好……
模型发布苦不苦,想想 Gemini 3.5 (pro) 好歹都高光过,总比胎死腹中要好…… 忒修斯的船板: 有种预感即将到来的几个模型会让K3光环熄灭的速度比GLM-5.2还快
Google,醒醒!不要再玩域名啦! Gemini 都快排不进首屏了 🤦🏻♀️
Google,醒醒!不要再玩域名啦! Gemini 都快排不进首屏了 🤦🏻♀️ Google AI Studio: 🧵 drop your custom ai studio domains, we want to see what you're building 👇
NotebookLM 正式改名为 Gemini Notebook 我们又见证了一个产品从大厂内部孵化、破圈、归入主线的过程。 只是很可惜的是,NotebookLM 当时真的很惊艳,带来了和当...
NotebookLM 正式改名为 Gemini Notebook 我们又见证了一个产品从大厂内部孵化、破圈、归入主线的过程。 只是很可惜的是,NotebookLM 当时真的很惊艳,带来了和当时众多 AI Chatbot 非常不一样的研究产品体验。 而 Gemini 一直都是很奇怪的存在,超级大厂的主打产品,却做的如此之差! Gemini Notebook: 3 years ago we started as a tiny experiment with the goal of helping you learn faster. Since then, we grew to bring audio, video, and interactivity to your sources, transitioning from a passive workspace to your true research companion. And now, notebooks have even become an
RT U哥: 这几天油管的这类vox风格的视频我看了一轮,给大家避下坑 1,所谓的某AI+某AI可以做出这样的作品,这话没错,但这里有个巨坑是,这并不是你给一个主题,...
RT U哥 这几天油管的这类vox风格的视频我看了一轮,给大家避下坑 1,所谓的某AI+某AI可以做出这样的作品,这话没错,但这里有个巨坑是,这并不是你给一个主题,给一个文案就能一键做出这样效果的。 2,你要去构思素材是什么,他们之间如何配合,动画效果是什么。如果你无法判断这些,提供这些,AI可以完成,但你做了之后你会发现怎么同样的工具,我做出来是一坨屎呢 3,AI写作,AI影视,AI剪辑,他们本质都是一件事: 你会写,你才能判断以及引导AI怎么写的更好 你懂电影,你才能判断以及引导AI怎么做好分镜头,运镜,人物站位,脚本剧情 你会剪辑,你才能判断剪辑审美是什么,流畅感来自于什么,而不是剪辑程序上的功能和按钮 泼个冷水,也说句实话,你要专注于自己的能力,工具是你的杠杆,你才是所有数字前面的那第一位数。 这话的意思大致就是,鲁迅用豆包,一定也比你用Claude强百倍。 季白羽: 刚才在油管刷到的视频, 用vox风格的图片, 然后用了Gemini Omin做视频, 这效果杠杆的。
谷歌测试Gemini语音自定义功能,新增速度、活力等四项调节选项
谷歌正在为 Gemini 开发全新的语音自定义功能,允许用户通过多个参数调整AI助手的声音表现。据 Google 应用测试版代码分析显示,谷歌计划推出包含“速度、活力、正式度和亲切感”四个滑块的语音控制菜单,让用户能够更精细地塑造Gemini的交流风格。 该功能由9to5Google团队在 Google 应用17.41.12测试版APK中发现,相关代码显示,用户未来无需局限于预设语音选项,而可以通过滑动调节器改变Gemini的语音个性。自定义设置预计将同时应用于 Gemini Live 实时对话模式以及普通聊天场景。 其中,“速度”选项提供慢、正常、快三档调节,用于控制AI回复节奏;“活力”“正式度”和“亲切感”则主要影响语音表达方式,帮助用户根据不同场景调整助手风格。例如,用户可以降低正式度、提高亲切感,让Gemini更适合旅行规划等轻松交流;也可以提升正式度,用于研究分析等专业场景。 此次升级体现了谷歌提升AI交互自然度的方向。此前,公司已在开发基于地区方言的语音支持能力,希望进一步增强语音助手的本地化表现。 随着移动AI助手竞争加剧,苹果也在iOS27中加入了Siri相关自定义选项,允许用户调整语速和表达效果。不过,谷歌此次更侧重于AI人格化和情感表达,通过“活力”“亲切感”等维度增强对话体验。 业内认为,语音助手未来的发展不仅取决于理解能力,也取决于交互中的情绪适配能力。通过提供更精细的声音控制,AI助手有望减少机械化交流带来的距离感,进一步接近自然人机沟通模式。
Gemini 养一帮人真的是天天吃白饭,人家 Codex 一天发几个版本,他们几个月才更新一次,这一年来 Gemini 网页版没半点长进,上次升级还把原来好用 Gem 列表从左...
Gemini 养一帮人真的是天天吃白饭,人家 Codex 一天发几个版本,他们几个月才更新一次,这一年来 Gemini 网页版没半点长进,上次升级还把原来好用 Gem 列表从左边 sidebar 去掉了,到现在都不支持 Skills。 🚨 AI News | TestingCatalog: Google is working on a native menu for Skills on Gemini desktop. These Skills may become available in all chats (fingers crossed). Users will be able to upload, create, and edit their Gemini Skills, as well as use Gemini to create them. Skill folders will also be available
Google Vids引入Gemini Omni模型 上传自拍+音频就能定制专属数字分身
哪怕OpenAI的Sora可能已经退场,谷歌依旧认定,用户想在AI视频里亲自出镜的那股执念并没有降温。本周四,这家科技巨头给Google Vids甩出一套重磅更新:你只需上传一张自拍和一段语音录音,系统就能捏出一个在外貌和声音上都与你高度吻合的专属数字虚拟人。换句话说,镜头前不用真人到场,一个数字分身就能替你把话讲了。 与数字人同步登场的,是谷歌把自家多模态模型Gemini Omni塞进了Vids平台。这套组合让视频生成变成了一场文字与图片的对话——用户把文字提示词和上传的参考图结合,就能产出自标的视频。Omni还顺手塞进了几项实打用的本领:给手机随手拍的视频换背景、修光线、加 特效 都不在话下。更讨喜的是,它现在支持渐进式编辑,创作途中可以一步一步改,不满意也不用推倒重来,省掉了反复从零开局的折磨。 这一连串升级,正在把Google Vids从一名AI辅助办公演示的工具人,拽向全能型视频创作平台的赛道。把Vids收编进Google Workspace,谷歌释放的信号很直白:它想成为企业做内部通告、培训视频等场景的商业利器。只不过,个性化虚拟人和对话式编辑这两张新牌打出来,也不可避免地让它和HeyGen、Synthesia、Captions、D-ID这些AI视频初创公司,正面撞在了同一条赛道上。 安全与合规这关,谷歌想在了前面。它特别强调,新的AI虚拟人会被严格绑定到账户持有者的真实样貌及其Google账户,并通过SynthID技术打上隐形水印。这道防线意味着,你没法拿它去炮制别人的恶搞或虚假视频,比如给谷歌CEO桑达尔·皮查伊来一张换脸恶作剧。目前,个人虚拟人功能的访问权限只向特定地区、年满18岁的用户开放。当AI分身开始走进办公套件,谷歌试图证明的,是便利与边界可以同框。
NotebookLM改姓Gemini了:一次更名背后,谷歌给笔记本塞进了会写会跑代码的云电脑
用惯了NotebookLM的人,可能得重新认识这位老朋友了。当地时间16日,谷歌宣布把旗下AI笔记助理NotebookLM正式更名为Gemini Notebook,让它彻底并入统一的人工智能品牌旗下。名字变了,身份却没被稀释——谷歌强调,它依然是一款独立产品,只是从此要在包括Gemini应用和Google搜索在内的整个谷歌生态里,扮演一个分量更重的角色。 真正的看点藏在更名背后的能力升级。Gemini Notebook用户将逐步收到一项关键更新:为笔记本接入安全的云端计算机支持。这一步等于给一本安静的笔记本装上了会动手的大脑——它由此获得了原生的代码编写与执行能力,用户可以直接基于自己的数据源展开复杂的数据分析,而不必再把资料搬到别处另起炉灶。笔记本不再只是记录和检索的容器,而变成了一个能就地运算、就地出结果的工作台。 这项更新目前已率先向Google AI Ultra用户,以及拥有AI Ultra Access和AI Expanded Access的Workspace企业客户开放。谷歌透露,未来几周内它还将陆续覆盖所有网页版Pro用户,届时会一并带来全新的输出格式与更深入的分析能力。一次看似寻常的改名,实则是谷歌把AI笔记本往生产力工具更深处又推了一大步。
RT Sumanth: Open-source framework for building real-time voice AI agents! Pipecat is a Python framework for orchestrating audio, video, AI services, t...
RT Sumanth Open-source framework for building real-time voice AI agents! Pipecat is a Python framework for orchestrating audio, video, AI services, transports, and conversation pipelines. Voice-first architecture with pluggable components. What you can build: voice assistants, AI companions, multimodal interfaces, interactive storytelling, business agents (customer support, intake), and complex dialog systems. The framework handles speech recognition, text-to-speech, conversation logic, and real-time interaction. WebRTC and WebSocket transport built in. Ultra-low latency for natural conversations. Why Pipecat: • Voice-first: Integrates STT, TTS, and conversation handling in one framework • Pluggable: Supports multiple AI service providers for each capability • Composable pipelines: Build complex behavior from modular components • Real-time: Low-latency interaction with streaming audio/video Supported services: • Speech-to-Text: Deepgram, AssemblyAI, OpenAI Whisper, Groq, Azure, AWS, Google, and more • LLMs: OpenAI, Anthropic, Gemini, Groq, Mistral, Ollama, AWS, Azure, and more • Text-to-Speech: OpenAI, ElevenLabs, Deepgram, Cartesia, Azure, AWS, Google, and more • Speech-to-Speech: OpenAI Realtime, Gemini Multimodal Live, AWS Nova Sonic, Ultravox, Grok Voice Agent I've wrote a detailed tutorial on building a production customer support voice agent recently - covering turn detection, interruption handling, telephony codecs, and how to inject live business context into every call. I've quoted the article! Sumanth: