KNOWLEDGE INDEX · 实体

DeepSeek

DeepSeek

26条关联资讯

也可检索深度求索

CHRONOLOGICAL RECORD

返回实体索引
2026

Simon Willison's Weblog资讯

Are AI labs pelicanmaxxing?

Are AI labs pelicanmaxxing? Excellent piece of work by Dylan Castillo, who took a deep-dive into the frequently pondered question of whether the AI labs have been deliberately training models to draw pelicans riding bicycles in response to my deeply unscientific benchmark. I've been randomly spot-checking this in the past by testing models against other animals riding other types of vehicle, but never with anything close to the diligence of Dylan's methodology here. Dylan took 8 animals × 6 vehicles = 48 prompts and ran them three times each through 7 different models ( GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, and DeepSeek V4 Pro). He then used GPT-5.6 Luna and Gemini 3.1 Flash-Lite to help evaluate the results. There's a neat filter view for exploring the results: For the models he tested he could find no evidence of pelimaxxing: The pelicans on bicycles don’t look any better Labs are not better at drawing pelicans Labs are not better at drawing bicycles Labs are not better at drawing pelicans on bicycles, even adjusting for difficulty The pelican-bicycle scenes don’t look memorized [...] Pelicans aren’t drawn any better than other animals. Bicycles aren’t drawn any better than other vehicles. And no lab draws the combination better than its pelicans and bicycles already predict. GLM-5.2 comes closest: it has the largest boost on the exact pelican-bicycle cell, and and its first pelican-on-bicycle sample caught my eye. But the effect is small and not significant, so I wouldn’t put too much weight on it. Via Hacker News Tags: ai, generative-ai, llms, evals, pelican-riding-a-bicycle

2026

aibase资讯

微软测试月之暗面 Kimi K3,或将引入 Copilot 与 Azure 平台

据《The Information》报道,微软正在测试月之暗面(Moonshot AI) 最新 模型 Kimi K3,评估其接入 Microsoft Copilot 的可行性,同时推进该模型进入 Azure 平台。目前,Kimi K3仍处于微软内部测试与平台接入阶段,尚未正式成为 Copilot 可选模型,微软也未公布其在 Azure 上的具体上线时间、服务地区及定价信息。 这并非微软 首次 引入月之暗面模型。7月1日,GitHub Copilot 已正式上线 Kimi K2.7Code,将其作为首个进入 Copilot 模型选择器的开放权重模型,并由 GitHub 基于微软 Azure 提供托管服务。该模型首先面向 Copilot Pro、Pro+ 和 Max 用户开放,企业用户则需由管理员手动启用。 目前,微软已在 Microsoft Foundry 平台提供 Kimi K2、Kimi K2.5和 Kimi K2.6等系列模型。若 Kimi K3后续正式接入 Azure,企业客户将能够通过微软云计算基础设施、统一计费体系和企业管理能力调用该模型,无需直接连接月之暗面的服务。 微软持续扩展 Copilot 和 Azure 的模型选择范围,反映出其 AI 产品战略正在向多模型架构演进。除长期合作伙伴 OpenAI 外,微软近年来已陆续引入 Anthropic、DeepSeek、xAI、Meta 以及月之暗面等公司的模型,根据不同任务需求,在性能、成本和应用场景之间提供更灵活的选择。Kimi K3的潜在接入,也将进一步丰富企业级 AI 应用生态的模型供给。

2026

aibase资讯

OpenRouter推出全新技术:多轮 Agent 调用成本最高可砍到 1.75 倍

多轮对话中,智能体每一轮都要重复发送相同的系统提示词、工具定义、架构和策略指令。一个 6 轮会话里,即使 唯一 变化的是用户 最新 消息或工具返回结果,开头那段重复内容仍可能被计费 6 次。OpenRouter 近日推出的 Prompt Caching 配合 Sticky Routing,正是为了解决这一成本黑洞。 Prompt Caching 的核心逻辑是:服务提供商从缓存中读取提示词中重复的部分,而非每次都按全价收费。Sticky Routing 则通过将会话固定到持有热缓存的同一提供商,使这一机制在跨轮次中持续生效。 缓存读取成本为正常输入的 0.1 到 0.5 倍 缓存读取价格因提供商而异。Anthropic Claude Sonnet 4.6 上,缓存读取为每百万 token 0.30 美元,而输入价格为 3.00 美元,恰好是 0.1 倍。DeepSeek 和阿里通义千问同样提供 0.1 倍读取价格;OpenAI 为 0.25 至 0.5 倍;Gemini、Grok、月之暗面为 0.25 倍;Groq 为 0.5 倍。 但缓存并非免费午餐。 首次 请求需要支付缓存写入费用,且部分提供商的写入成本高于普通输入。Anthropic 默认 5 分钟 TTL 的写入成本是输入价格的 1.25 倍,1 小时 TTL 则为 2.0 倍——一次从未被复用的写入,成本反而比不用缓存更高。OpenAI GPT-5.6 及之后版本写入成本为 1.25 倍输入价格。Google Gemini、Grok、月之暗面、Groq 的写入则免费。 热缓存的隐形陷阱:提供商漂移 缓存写入后,如果下一轮请求被路由到不同提供商,热缓存便失效。OpenRouter 支持 70 多个提供商,第二轮命中冷端点的概率并不低。这就是 Sticky Routing 的价值所在——在缓存请求后,当该提供商的缓存读取价格低于常规输入时,后续请求会被固定回同一端点。若该提供商不可用,则回退到下一个可用端点,而非让请求失败。 默认情况下,OpenRouter 通过哈希对话的 第一 条系统消息和 第一 条非系统消息来识别会话。但智能体常在轮次间重写开头消息(如总结状态、重新排序工具上下文),导致哈希值变化、会话漂移。解决方案是使用显式的 `session_id`。设置后,OpenRouter 直接将其作为粘性路由键,粘性在 首次 成功请求后即生效,而非等到缓存命中后才启动。`session_id` 可作为请求体顶层字段或 `x-session-id` 请求头发送,需在整个对话期间保持稳定,控制在 256 字符以内。 缓存未命中的四大原因 一是提示词低于提供商 最低 要求。Anthropic Claude Opus 4.5–4.8 和 Haiku 4.5 需 4096 token,Haiku 3.5 需 2048 token,Sonnet 4/4.5/4.6 和 Opus 4/4.1 需 1024 token;OpenAI 需 1024 token;Gemini 2.5 Pro 需 4096 token,Flash 需 1024 token。 二是缓存过期。Anthropic 默认 5 分钟,可选 1 小时;Gemini 隐式缓存约 3–5 分钟且读取时不重置 TTL。 三是提示词开头不断变化。应将稳定内容(系统指令、工具、模式、参考资料)放在前面,变化内容(用户问题、时间戳、工具输出)放在后面。 第一 条系统消息中的时间戳会让每一轮提示词看起来都是新的,如非必要应移至后面的消息中。 四是请求被路由到不同提供商。智能体工作流应设置 `session_id` 并依赖粘性路由保持会话在已预热的提供商上。若自行设置 `provider.order`,会覆盖粘性路由。 节省的成本随轮次增加而增长。对于多轮对话,当重复使用的内容随对话增长时,使用自动缓存;当确切知道哪些大块内容应被缓存时(如检索文档、长参考文件、角色卡、CSV 数据),使用显式缓存断点;对于智能体会话、支持工单、聊天线程、工作流运行,以及开场消息可能在轮次间变化的对话,使用 `session_id`;对于较长的 Anthropic 会话,当默认 5 分钟缓存可能过期时,使用 1 小时缓存。 确认缓存是否生效,可检查响应中 `usage.prompt_tokens_details.cached_tokens` 字段,大于零即命中;`cache_write_tokens` 显示写入量;`cache_discount` 可查看单次生成的成本影响。这些信息也可在 Activity 页面或 `/api/v1/generation` API 中获取。

2026

aibase资讯

美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需

OpenAI前首席技术官穆拉蒂离开老东家后交出的 第一 份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布 首款 模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺 第一。 单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。 真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。 一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室, 首款 模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现 最强 的模型,无论开放模型还是闭源模型。 把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。 当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的 第一 梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。 之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。 穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。 但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。 Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。 真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有 顶尖 团队、充足资金和英伟达 最新 训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。 按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准 第一。 公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准 第一 并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。 美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%, 最高 一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测 最强 的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分 顶级 闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。 与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。 这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。 从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。

2026

新智元资讯

GPT-5.6-Sol在网络攻防能力上,超越了Mythos!开源模型也排好了

ASI启示录 2026-07-21 12:58 北京 新智元报道 GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5! 英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。 去年同类内部测试中,这个差距是 6 到 10 个月。 防御窗口在收缩,而攻击前沿在加速。 今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。 开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。 4 到 7 个月:怎么测的,差在哪 AISI 用两套体系评估模型的网络攻击能力。 第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。 第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。 两套体系给出了一致的结论: GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月; 在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。 DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。 两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。 成本差距比能力差距更大。 同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。 在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元; Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。 同等攻击能力,开源便宜一到两个数量级。 闭源模型的安全护栏也没能拉开差距。 AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。 Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。 Amazon 研究员随后独立报告了另一种绕过方法。 这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。 闭源并不自动等于安全。 防御窗口收窄 防御工具也在加速 AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。 英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。 同一代 AI 工具确实也在加速防御端的工作。 游戏网络编程领域的资深开发者 Glenn Fiedler,是哦哦游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库 (yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库) 做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。 Glenn Fiedler 两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。 最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。 整个审计的 Token 成本约 2500 美元。 攻防两端都在被 AI 加速,但加速方式不对称。 攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。 而防御工具的部署需要每个团队主动投入时间和成本。 AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。」 这组数据对 AGI 格局的影响比数字本身更深远。 开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。 闭

2026

aibase资讯

唐杰亲自剧透GLM-5.5:一句"史诗级plus",把国产大模型的军备赛又挑高了一截

国产大模型的密集爆发,正把和美国旗舰闭源AI的身位拉近到肉眼难辨。快科技7月20日报道,在千问、Kimi接连秀出肌肉之后,轮到智谱出手了,传闻中的GLM-5.5被描述为一轮史诗级提升。而这次不是媒体猜测,是智谱创始人唐杰亲自下了场。 有网友在评论里提到,千问和Kimi都完成了史诗级进化,顺口问了句GLM还有没有戏。唐杰的回应当场把期待值拉满——他用了一个词:史诗级plus。这意味着,在智谱自己的判断里,这一代的提升幅度比网友提到的那些还要大。 具体的数字现在当然无从谈起,但唐杰显然希望外界对GLM保持信心。他的底气来自上一代的战绩:在Kimi K3登场之前,GLM-5.2是国产大模型中 第一 个在AI编程能力上追平Opus级别性能的选手。更值得注意的是它的体量——GLM-5.2的参数规模只有7400多亿,差不多是Kimi K3的四分之一,大概也只有美国 顶级 AI的五分之一甚至更少,却硬是靠后训练把能力托到了那个水位,堪称小参数撬动大能力的样本。 唐杰口中的史诗级plus新模型,指向的应该是下一代GLM-5.5。此前圈内传过GLM-5.3的名字,但现在看GLM-5.5的可能性更大,当然也不排除发布时直接冠上GLM-6的名号。一个可以确定的趋势是,下一代大模型的参数量至少会迈过1万亿的门槛。考虑到智谱历史上曾使用过DeepSeek开源的基模,外界猜测GLM-5.5或许会做到与V4Pro 同级 的1.6万亿参数;再叠加智谱公认颇强的后训练功力,其性能跃升确实值得押注,很可能又是一个对标Fable5量级的国产大模型。 不过在国产阵营的等待名单里,眼下最让人坐立难安的,还是DeepSeek V4的正式版。报道发出时,7月中旬的最后一刻——当天零点——正悬在头顶,那条小鲸鱼究竟是打算半夜甩出大招,还是又一次跳了票,谁也说不准。当智谱用一句史诗级plus把话题点燃,国产大模型这场接力赛,显然还远没到撞线的时候。

2026

数字生命卡兹克资讯

AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜。

原创 数字生命卡兹克 2026-07-21 09:11 北京 一个Token验真伪 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 Llama 3.3,则多数是53。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。 所以说,为啥 布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证, 看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。 只需要模型输出一个 Token,就够锁定你是谁。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 而且这事之所以这么普遍,纯粹是经济结构决定的。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 但问题在于, CISPA 这套 LLMmap的 方法依然很重。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的 LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个

2026

aibase资讯

腾讯WorkBuddy6月访问量超2000万,领跑AI办公智能体市场

最新 发布的《2026年Q2中国办公智能体平台市场洞察报告》显示,腾讯WorkBuddy在国内PC端AI原生办公智能体市场保持领先,2026年6月单月访问量达到2097万次,超过第二、第三名总和。 报告显示,6月中国PC端AI原生办公智能体市场总访问量突破6000万次,行业规模持续扩大。腾讯旗下AI编程智能体CodeBuddy也保持头部位置。 作为AI效率办公智能体,WorkBuddy支持用户通过自然语言指令完成任务规划、文件处理和结果交付,可在PC、微信小程序、App等多端使用。 自2026年3月发布以来,WorkBuddy持续升级,已接入混元、DeepSeek、智谱GLM、Kimi等主流大模型,并上线技能中心、专家模式、自动化任务、资料库等功能,同时支持微信、企业微信等渠道连接,并通过中国信通院可信认证。 随着AI智能体逐渐从内容生成走向任务执行,办公领域成为大模型落地的重要场景。WorkBuddy的增长也体现出市场对AI原生生产力工具需求的快速提升。

2026

aibase资讯

8800 万美元加注开源:Ollama跑进85%财富 500 强,喊出"全体上车"

一条命令就能在本地拉起开源大模型,这个让无数开发者摆脱API密钥和天价账单的工具,刚刚拿到了通往下一程的燃料。 7 月 9 日,Ollama在官方博客中宣布完成 8800 万美元融资,投资方阵容横跨 顶级 风投与开源世界的老将:Benchmark的Peter Fenton、Theory Ventures的Tomasz Tunguz、8VC的Alex Kolicich共同领投,Docker创始人Solomon Hykes、ClickHouse CEO Aaron Katz、GIMP联合创建者兼Cockroach Labs联合创始人Spencer Kimball、Amp CEO Quinn Slack、思科董事会成员Marianna Tessel、Twitter前工程主管Michael Montano,以及Y Combinator、Garage Capital、Pace Capital、49 Palms、GTMFund等一众天使跟投。 这家公司的创始人杰夫与迈克尔,十年前就在做同样的事。两人在大学相识,创办了让Docker运行变得极简的Kitematic, 2015 年被Docker收购,他们的工作成果后来化为 2016 年推出的Docker Desktop,如今被全球超过一千万开发者使用。十年之后,他们把那套让复杂技术变得人人可用的执念,又押到了AI上——Ollama的目标,是让开发者以最轻松的方式启动并运行开源模型。出乎他们最疯狂的想象,这个平台已经服务了 890 万开发者,并且被85%的《财富》 500 强企业采用。 在Ollama的叙述里,开源模型正在为AI开启一次个人电脑式的时刻:当年PC把算力从大型机机房搬上每个人的桌面,供人拥有、定制和构建,如今开源模型正做着同样的事。几年前,强大而免费的开源模型已经出现,但要让它们真正跑起来却障碍重重,能力明明在场,却像被锁在门后,开发者无法像调用专有模型API那样顺手使用。Ollama给出的解法是一款可下载到电脑上的应用,一条命令就能启动 最新 开源模型,再通过简单的API在其上构建,把运行开源模型变得和运行任何普通软件一样简单——不需要权限,不需要API密钥,也不需要昂贵的服务器硬件。你的模型,你的机器,你的数据。 它围绕三条原则搭建产品:所有权、可负担性与隐私。所有权意味着开源模型归使用者所有,可以随时保留、定制和优化,永远不会被锁死在某一款自己智能体或应用所依赖的模型之外;可负担性来自模型跑在自己的硬件上,不再有失控的按token计费账单,实验、迭代和发布都不必担心每一条提示词都在加价;隐私则让数据永远不必离开本地机器,即便真的需要上云扩展,也能把同一份信任一并带过去。 开源模型早已不是实验室里的玩具。Ollama云成了访问 最强 大开源模型最便捷的一站,GLM、Nemotron、DeepSeek、Kimi、MiniMax等都在其中,而它的token用量平均每月增长超过一倍。最初只是个人电脑上 第一 次跑通模型的乐趣,如今已经扩张成去啃那些曾经专属于闭源模型的硬骨头。 这笔 8800 万美元,被Ollama定位成推动生态前进的燃料。它正处在开源模型生态的核心位置,资金将投向三件事:无缝的混合推理、在新开源模型发布当天就提供支持,以及一个能让任何开发者及其团队用上 最强 大模型、却不牺牲所有权与隐私的云服务。杰夫与迈克尔在结尾写道,他们曾站在类似变革的开端,押注开放与易用终将胜出,如今再次倾尽所有。当85%的财富 500 强已经悄悄把开源模型搬进内部系统,这趟开源列车的下一节车厢,显然还空着不少座位。

2026

aibase资讯

DeepSeek V4正式版实测曝光,或于下周一发布剑指Kimi K3

在全球AI圈目光聚焦于Kimi K3热度之际,国产大模型厂商DeepSeek传来新动向。近日,DeepSeek V4正式版的测试视频与实机演示在社交平台悄然曝光,多方消息指出,该模型有望最早于下周一(7月下旬首个周一)正式发布,时间点恰好承接K3刷屏之后,引发行业高度关注。 据流出的测试信息与海外博主反馈,DeepSeek V4正式版在多项核心指标上表现惊艳。实测性能初步达到Claude Opus4.8的水平,尤其在3D方向的生成能力上远超Opus4.8,代理(Agent)行为表现与编码稳健性亦有显著提升。更有激进观点称,在特定测试(如游戏代码生成)中,V4正式版已压过Fable5与GPT-5.6一头。一位博主展示的《鱿鱼游戏》小游戏编码测试中,V4生成3000行代码总成本仅0.12美元,凸显了其令人难以置信的性价比优势。 除了硬性能的提升,V4在交互体验上也迎来微调。测试者注意到其思维链(CoT)风格更加接近Claude,不再堆砌代码墙,而是以“编写核心功能”、“编写主要场景代码”等总结性步骤呈现,可读性大幅增强。有分析认为,V4可能提炼了Fable的编码风格,输出观感更为简洁。 回顾DeepSeek过往节奏,其一贯以“闷头干活、价格屠夫”的策略突围。若V4真能以低一个量级的价格逼近当前顶流模型水准,势必将掀起继V3之后的“DeepSeek时刻2.0”。目前官方曾预告为7月中旬发布,下周一的时间线合乎预期,最终定档尚需等待官方官宣。

2026

数字生命卡兹克资讯

不会代码也能做产品,这是一份从0开始的Vibe Coding保姆级教程。

原创 数字生命卡兹克 2026-07-20 08:08 北京 Agent就是我们最好的老师 最近,国产大模型也都起飞了。 基本都达到了半步Fable 5境界。 2.8T的Kimi K3,2.4T的Qwen 3.8 Max,而在未来,肉眼可见的,还有马上上线的DeepSeek V4正式版,还有Seed、GLM、MiMo、LongCat等等要到来的更大规模的版本。 我觉得,这就是所有在国内,想用AI搓一个自己的产品、所有想把自己想法变成现实的人,最好的黄金岁月。 现在,你不需要捏着鼻子用海外的模型了,考虑到对面封号、考虑到魔法、考虑付费等等,你可以直起身来,用我们自己的模型,来做你自己想做的东西。 包括我自己搓的产品AIHOT,从5月发布开始,到今天,2个多月的时间,最近一周的周活终于过了30万,月活也正式过了60万。 所以,我觉得今天,我也可以分享一下,作为一个纯外行,如果你想从0开始,用国产模型,徒手搓出一个完全属于自己的产品,应该需要哪些步骤和流程,还有一些乱七八糟的坑。 先叠甲一下,下面这套流程,是我自己作为非专业者,目前跑得比较舒服的一条路径,主要面向完全不懂代码、想先把第一个产品做出来的人。不同类型的产品,可以选择不同的托管平台,工程团队也会有不同的开发规范。 这里讲的是一条足够简单、能够从零走到正式上线的方案,完全不代表唯一的标准答案。 那,让我们开始吧。 1. 买一个国产大模型的Coding Plan套餐。 你需要一个能帮你写代码的AI。 Kimi、GLM、Qwen等等都无所谓,能买到哪个就用哪个,差距没有你想象的大。 2. 去下载各家官方的Agent编程产品。 买了Coding Plan之后,去下载各家官方的Agent编程产品。 ZCode、Qoder、Kimi Code等等,你买了哪家的Coding Plan就用哪家的,因为未来肯定是自家的Agent更适合自家的大模型,可以提前用了。虽然现在很多的Harness还是不如Claude Code,但是我觉得会很快的补上。 3. 想好你的产品名字。 很多人觉得名字随便起一个就行了,做完再改。 但不是这样的,你后面所有的东西,logo、域名、备案、小程序名称、App Store上架,全都跟名字绑定,改名的成本比你想象的大一百倍。 名字简短、好记、最好有一点辨识度,起名的时候顺便在微信搜一下公众号、小程序有没有同名的,在App Store和各大应用商店搜一下有没有撞车的。 这一步花十分钟,能省你后面很多麻烦。 4. 注册一个域名。 名字想好的那一刻,立刻去注册域名。 去火山引擎、腾讯云、阿里云啥的都可以,去域名注册页面,搜你想要的域名。 我自己就是在这一步吃了亏,AIHOT当时真的就是随便取的,然后后面没想到这玩意做起来了,结果一查,AIHOT.com这个域名,是我可能永远都买不起的程度。。。 5. 买一台服务器。 你的产品做出来之后,它得有一个地方运行,不能跑在你自己电脑上,你电脑一关,全世界都访问不了了。 为了让整套教程拥有一条统一、直观的路径,所以我们下面都以以云服务器为例,部分静态网站和轻量产品也可以使用Serverless、云开发或托管平台啥的,不一定需要自己维护服务器。 不过现在维护服务器因为有了Agent之后,维护已经很简单了。 买服务器这里,推荐一下腾讯云上的服务器,新客一般都有大优惠,一年一个轻量的可能才99或者199,轻度产品使用足够了,不知道配置怎么选,就直接截图问你的AI,告诉它你想做什么产品,让它帮你挑。 当然,最好的方式,就是让Agent操控你的浏览器,直接帮你选。 6. 同步去做ICP备案。 这一步非常重要。 在中国大陆,你的域名如果要对外提供服务,必须做ICP备案。不备案,域名解析直接被运营商拦截,用户打不开你的网站。 在你买服务器的那个云平台上找到“备案”入口,按指引提交身份证、域名信息、网站名称,然后等审核,一般一到两周。 一定要跟开发同步进行,别等产品做完了才想起来备案。 如果你做的是出海产品,那就无所谓了,但出海的话记得买海外服务器,比如新加坡或者美西的节点,离你的目标用户近一些。 7. 新建一个你的项目文件夹。 OK,准备工作全部做完了。域名有了,服务器有了,备案提交了,AI编程工具也装好了。 现在,在你的电脑上新建一个文件夹。 就这样。起一个跟你产品名字一样的文件夹名,放在你喜欢的位置。 这个文件夹,就是你接下来整个产品的家,你的所有代码、所有配置、所有文档,都会在这个文件夹里。 8. 在这个项目文件夹下,启动你的Agent,开始开发。 打开你第2步装好的Agent编程产品,把工作目录指向你刚才建的那个文件夹。 具体怎么操作,每个产品不太一样,但大致都是"选择一个工作目录"然后开始对话。 从这一刻开始,你的AI就驻扎在你的项目里了,它能看到你的文件,能帮你创建新文件,能帮你写代码、跑代码、调代码。 9. 注册一个GitHub账号。 GitHub是全球最大的代码托管平台。 你的代码不能只存在你自己电脑上,万一硬盘坏了、电脑丢了,你什么都没了。 所以,可以注册一个GitHub账号(免费的),让Agent帮你连接上你的GitHub账号,然后把你的代码推到GitHub上的一个私有仓库里,注意是私有仓库,不是公开的。 整体告诉你的Agent一句话就行了。 “初始化Git仓库,连接我的GitHub账号,创建一个私有GitHub仓库,并提交第一个初始版本。” 现在,你和Agent你们两两个的协作,正式开始。 10. 开启Plan模式,说清楚你要做什么。 大多数Agent编程产品都有一个Plan模式(或者叫规划模式),用人话告诉AI你想做什么,它会先帮你理清楚需要做哪些事情,列出一个计划清单,别直接开始执行。 你在这一步要做的事情就是,用最简单直白的语言,描述你的产品。 注意,不要想太多,你不需要画原型图,不需要写需求文档,不需要列所有功能,就说你最核心想要的那个东西,后面的功能可以慢慢加,但第一版可以比较简单。 先看到那个产品出来的正反馈,比什么都要强。 AI会根据你的描述生成一份规划文档,你看一下是不是你想要的方向,确认了就进入下一步。 11. 让Agent根据Plan文档,开始执行开发。 确认了Plan之后,告诉Agent开始执行。 它会自动创建项目结构、写代码、装依赖等等,你什么都不用管,看着它干活就行,过程中,它做完一块会问你要不要看看效果,或者有没

2026

GitHub Trending项目

OmniRoute

永不停歇地编码。免费 MIT 许可的 AI 网关:一个端点,268+ 提供商(50+ 免费),500+ 模型——Claude、GPT、Gemini、Kimi K3、GLM、DeepSeek。兼容 Claude Code、Codex、Cursor、Cline 和 Copilot。配额感知自动回退,RTK+Caveman 压缩可节省 15-95% tokens,支持 MCP/A2A、多模态、桌面/PWA。由 500+ 贡献者打造。

2026

twitter-meng shao资讯

DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qw

RT meng shao DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂

2026

数字生命卡兹克资讯

Kimi正式发布2.8万亿大模型K3,这是属于我们的荣光。

原创 数字生命卡兹克 2026-07-17 06:08 上海 大就是好 今天凌晨,Kimi K3,终于正式跟大家见面了。 2.8万亿参数,百万上下文。 而且,官宣7月27号,全面开源。 没啥可说的,让我们此刻一起欢呼吧。 月之暗面昨天下午就发了预告,片子也非常的艺术,在他们心中,这是一个能证明自己、将整个月之暗面,带向新一个时代的模型。 如果说智谱是做后训练的神,把GLM-5系列带到了一个全新的高度。 那在我心中,其实国内做预训练的扛把子,一直都是Kimi。 而且一直都是大参数的代表。 K2是几个月前国内第一个把模型推到1T级别的。 过去还有很多人说,大模型的Scaling Law要见顶了,要失效了。 可如今发现我们发现,大依然就是好,大依然就是牛逼,大依然就是智能。 就像我至今依然觉得Claude Opus 4.6是我心中最水桶级别的白月光,写作创意认知Agent代码能力都极强,因为那可是个5T的模型啊。 后面Opus 4.7和4.8就强化学习一路强化歪了,Coding能力确实提升了,但是创意和规划能力拉完了,非常明显的一路下滑,口碑一路崩塌。。。 至于现在最牛逼的Claude Fable 5的参数量,目前没人知道,但是跟一些朋友讨论和猜测,可能到了10T级别,因为现在Grok内部训得最高参数量的模型也是10T级别,感觉应该差不多。。。 再把眼光放回到国内,Kimi之后,DeepSeek V4 pro和美团的LongCat 2.0也都迈入了万亿级别,逐渐的,万亿参数模型,已经快成了标配。 而今天,Kimi K3来了。 这一次,他们把模型的参数量推到了2.8T级别,这是国内的第一个3万亿参数级别的模型,而且更是全世界,第一个面向所有人开源的3万亿参数级别的模型。 开心,为Kimi感到自豪。 老规矩,再看下Kimi K3的跑分。 先看AA给的智能分数,Kimi K3来到了第三,仅次于Fable 5和GPT-5.6 Sol,超过了其他所有的模型。 这一下,kimi代替Google,成为新一代御三家了。。。 然后再看Coding。 也正好趁着这个机会,我想用这些评测集来结合我的体感,简单给大家看看一个模型的性格和特点怎么理解。 每个模型其实都是有自己擅长和不擅长的,强如Falble 5,其实也有短板,只不过它的短板的高度,比很多模型的长板甚至还要长。 先说Coding这块,一共六个评测,其实我们可以把它们分成两类来看。 第一类,我自己喜欢叫它精准执行型评测,大概就是测模型能不能精确地完成一个明确的任务,不多不少,不漏不错。 你可以理解成老板给你一个非常明确的任务清单,上面写得清清楚楚要改什么。这种任务考验的就是精准度和执行力,你得理解需求、定位问题、精准修改、不引入新bug。 DeepSWE和Terminal Bench 2.1这两个就是比较典型的,一个更偏纯执行,一个更偏综合性的执行。 GPT-5.6 Sol在这两个评测中都拿到了第一,它在需求理解、环境操作、调试收敛和最终交付方面确实就是最稳的,跟我日常使用的体感是一致的。 至于Opus 4.8,幻觉率太高,我骂了很多回了,这个位置跟我体感也是一致。 而Kimi K3,在执行的精准度上,在DeepSWE上仅次于Claude Fable 5和GPT 5.6 Sol,而在Terminal Bench 2.1上,甚至拿到了第二名。 第二类评测就反过来了,我叫它方案规划型。 比如FrontierSWE,这个测的是前沿级别的、特别难的软件工程问题,需要创造性思考、深度理解复杂系统才能解决的问题。 Fable 5基本没啥可说的,断崖式领先所有的,GPT系列大家都知道创新型任务还有方案设计做的一直都很差,比Fable 5差了很多,是GPT系列的短板,而这次,Kimi K3直接一脚插在了Fable 5和GPT-5.6 Sol之间。 从这个就可以看出来Kimi K3的定位了,可以说非常的中庸之道。 也就是各方面都不错,一个非常全面的水桶模型,在每一个领域里,虽然都打不过那个最强的,但是总能排到第二或者第三。 坦诚的讲,这样的水桶模型,在日常使用中,反而体验感可能会更好一些,我现在经常就是Fable 5和GPT-5.6 Sol来回切换,一边做方案,一边做执行,确实是目前最强组合,但是也麻烦啊。。。 更别提国内,有多少人用不上Fable 5的了。 海外还有人说,Kimi又是靠蒸馏啥的,但是讲道理,这个级别已经不是蒸馏能蒸出来的了。 兰伯特都看不下了,直接是这么怼的。。。 我觉得非常有代表意义。 再来看很多人更看重的Agent能力,这个玩意主要跟Work强相关。 BrowseComp,测的是在浏览器环境下的复杂信息理解和处理,其实就是深度研究。你可以理解成“给模型一个浏览器,让它自己去网上找信息、理解内容、完成任务”,K3拿了91.2,全场第一,GPT-5.6 Sol以90.4紧随其后,Fable 5是88.0。 这个是kimi一贯的拿手好戏了,用过Kimi集群的应该都感受过它的威力。 Automation Bench,测的是自动化任务的执行能力,把一系列操作串起来自动完成,K3也是第一,

2026

twitter-meng shao资讯

DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent ...

DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂

2026

新智元资讯

Agent拉爆算力?中国杀出新物种:日冲10万亿Token,还赚钱了

ASI启示录 2026-07-19 17:53 北京 新智元报道 今年WAIC开幕当天,上海世博展区挤满了各种机器人、大模型和智能体。 但如果你问一圈做AI的人,2026年最让他们睡不着觉的事情是什么,答案出奇一致—— 不是模型不够强,是算力不够用了。 过去一年,AI行业发生了一个根本性的切换: 大模型从「陪聊」变成了「干活」。 这带来一个很直观的变化: Agent太能吃了。 这不是夸张。今年,密歇根大学、斯坦福等机构测算发现,在一组真实软件工程任务中,编码Agent每生成1个输出Token,背后平均要累计处理约154个输入Token。 更要命的是,这些Agent不是偶尔吃一顿,它们7×24小时不停地吃。行业里的共识是,今年AI推理的算力需求是去年的5倍到10倍。 与此同时,英伟达最新的高端卡今年很难大批进入国内,存量供给几乎没怎么增长。 需求暴涨,供给不动。怎么办? 就在今天,商汤在总部举办以「算创·无限」为主题的Agentic时代AI基础设施创新发展论坛。 本次论坛上,商汤给出了一个听起来有点反常识的答案: 不造更强的卡,而是把比赛拆开,让不同的卡接力跑。 一场铁人三项的启示 要理解商汤在做的事情,得先搞清楚一个技术概念。 大模型每一次推理,其实可以拆成两道工序。第一道叫 Prefill,就是「读题」:把用户扔过来的资料、文档、聊天记录、上下文全部读进去,理解清楚。第二道叫 Decode,就是「答题」:在理解的基础上,一个字一个字地往外蹦答案。 这两道工序对硬件的要求完全不同。 读题拼的是计算吞吐量——你得一口气吞下海量信息,越快越好。答题拼的是显存带宽——你得一个字一个字地往外挤,快不了但不能卡。 过去大家的做法是一张卡从头干到尾,既读题又答题。这就好比让一个人独自跑完铁人三项——游泳、骑车、长跑全包了。能不能跑完?能。但一定不是最优解。 商汤的思路是: 把铁人三项拆开,让三个运动员各跑自己最擅长的那段。 具体来说,就是 让通用国产卡去做Prefill——它们的计算吞吐量不差,干这个活效率很高。把高端卡集中起来做Decode——这是它们的绝对强项。 这就是所谓的「异构混合推理」。说白了,不是逼国产卡去硬刚英伟达,而是让每一张卡都去干自己最擅长的事情。 听起来很美,但这事能落地吗? 这事可远不是「把卡插上去就能跑」那么简单。 你想想看,一台Decode节点要同时协调三十个Prefill节点,这三十台芯片还可能来自不同厂家、不同代际。 网络怎么不堵?请求怎么分?长文档和短对话怎么区别对待?某张卡突然掉线怎么办?缓存命中率怎么保证? 商汤首席科学家张行程说得很实在: 纯英伟达方案4个Prefill对1个Decode就够了,换成国产方案变成30对1,网络复杂度、调度复杂度、容错复杂度全线飙升。 所以商汤这几年在底层做了海量的脏活累活——编译器、算子、网络、缓存、调度、容错,一层一层地打通。经过系统级调优,才能让这套复杂程度远高于英伟达方案的异构系统,实现长时间稳定运行,系统可靠性达到99.9%,真正实现大规模商用。 而且从2018年开始,商汤就在做多芯片适配,到今天形成了一整套方法论。 张行程说,这不单纯是技术上的方法论,更是一种组织上的方法论——商汤自己的研发团队、芯片原厂、高校和科研机构,有的深度绑定、有的灵活协作,拧在一起才啃得动这块骨头。 目前,这套方案已经在真实客户场景中跑通了。适配的模型包括GLM 5.2、DeepSeek V4、Kimi K2.7、MiniMax M3、SenseNova V6.7等主流大模型。 但光是「能跑」还不够。技术再漂亮,不赚钱就是玩具。接下来才是整个故事里最关键的一步。 国产算力,上桌吃饭 过去几年,国产算力的叙事基本上是这么个套路:自主可控很重要,供应链安全很紧迫,我们的芯片能跑了。然后呢?然后往往就没有然后了。 能跑,但是性价比不行。能用,但客户不买单。声音很大,账算不平。 商汤这次最让人意外的地方在于: 国产芯片参与的混推集群,已经实现了可盈利。 这里的「可盈利」不是财务游戏,商汤科技联合创始⼈、⼤装置事业群总裁杨帆给了一个非常明确的定义: 收入覆盖折旧、摊销、机柜租赁、电费和人员服务费之后,利润率为正。 是真金白银地赚钱。 怎么做到的? 第一步,把国产卡的实际性能「榨」出来。 商汤在三个不同厂牌的国产芯片上做定向优化,单卡MFU(可以理解为「有效利用率」)相比原厂出厂表现平均提升约一倍,最高的一款提升了152%。 第二步,通过异构混推,让同样成本产出更多Token。 相比国产同构推理,异构混推的同成本Token产出规模扩大了2.5倍。简单说,同样花那么多钱买卡和建机房,产出的Token多了一倍多。 第三步,Token量跑起来了。 年初日均4000亿Token,到7月底预计日均2.42万亿,年底目标是日均10万亿——全年预期增长25倍。账算得正是一回事,规模跑得起来才能证明这不是小打小闹。 这意味着, 国产算力第一次不必等到单卡全面追平英伟达,就通过系统分工,提前进入了真实的商业市场。 不是等着领先了再上桌,而是找准了自己的位置先坐下来——还挣到钱了。

2026

新智元资讯

刚刚,WAIC杀出国产「桌面超算」!150B大模型,放你桌上跑

ASI启示录 2026-07-17 21:03 北京 新智元报道 7月17日,上海,黄浦江畔,夏风滚烫。 2026世界人工智能大会(WAIC 2026)在上海世博、张江、西岸「三地四馆」同步引爆—— 超10万平方米展区、1100余家企业、3000余项展品、超300款全球首发产品集中亮相,9位图灵奖、诺贝尔奖得主参会。 这阵仗,用「盛况空前」都稍显克制。 而就在WAIC开幕的同一天上午,我们注意到一家国产芯片公司搞了一件大事。 此芯科技,一家成立于2021年、专注自研高性能智能体CPU的公司,在上海举办了一场以「芯聚无限 智启新元」为主题的发布会。 此次,他们正式发布了 AGX Agentic Compute 智能体计算战略——一把打通芯片、整机和操作系统,构建覆盖端、边、云的全域算力底座。 这步棋,下得正是时候。 DeepSeek掀起的国产芯片适配潮还在持续发酵,OpenAI和Anthropic相继官宣自研芯片,全球AI算力的版图正在被重新撕扯。 而在端侧,一个更深层的变化正在发生—— AI不再只是「聊天」,它开始真正「干活」了。 智能体(AI Agent)从概念走向落地,算力需求的重心也从「训练」向「推理与执行」急速迁移。 两条曲线撞在一起,一个被集体忽略的问题浮现—— 智能体,到底该跑在什么芯片上? 答案有多炸裂?发布会现场,一台办公桌大小的机器被抬上台——AGX Station。在配置相应AI加速卡后,可 本地推理70B至150B参数规模的大模型,多台设备还可级联组成桌面级算力集群。 算力的新货币,叫Token 今天上午,此芯科技创始人、CEO孙文剑登台,开口就扔出了一个判断: 我们正站在一个从「生成内容」到「完成工作」的范式跃迁的起点,而此芯科技,将是这场变革的核心驱动力。 这话乍听有点大。但顺着它的逻辑往下走,站得住。 过去几年,AI算力围着Scaling Law转,火力全部压在「训练」上训练是军备竞赛,但它只打一次。 模型训完了,真正烧钱的是接下来7×24小时永不停歇的推理账单。 但2026年风向变了。AI Agent不再是PPT上的愿景,而是真的开始拆任务、调工具、跑流程。Gartner预测,到2028年将有约三分之一的企业级软件内嵌智能体功能。 于是衡量算力的标准,从峰值算力转向任务完成效率,而 Token则成了智能体时代算力价值的新「货币」。 为什么偏偏是2026?孙文剑给了四个理由: 大模型迭代周期已经缩到「每几个礼拜」,能力撞上临界点; 工具链和框架把开发门槛按了下去,开发者蜂拥入场; 资本认定智能体是继大模型之后的又一个核心赛道; 而最关键的商业闭环,在过去半年内跑通了。 他顺手举了一个此芯自己的例子: 此芯的芯片是前年出来的,去年才和一批合作伙伴把底层硬件搭好——「那时候呢,其实还没有智能体。」 等智能体真的起来,他们回头一看,发现自己的硬件「非常适合做智能体」。这次伏笔被兑现了,机会留给了早有准备的人。 三大支柱:从一颗CPU 长成一张全域算力网 在孙文剑看来,智能体已经不是被动响应的知识库,而是能主动拆解目标、调用工具、执行任务的「任务执行者」。 它要真正规模化落地,卡在三件事上: 跑得稳、用得起、可持续。 正是基于这一洞察,此芯科技率先构建起AGI时代的智能体原生一体化平台。 发布会上,孙文剑正式发布AGX Agentic Compute战略。 围绕「跑得稳、用得起、可持续」三大命题,此芯科技确立了 三大战略支柱。 第一,聚焦智能体专用 CPU。 这是整个战略最硬的地基。 智能体的负载和聊天机器人完全不是一回事——它要连续思考,要频繁调用工具,要在长上下文里维持记忆。CPU不再是「打杂的」,而是任务调度与执行的中枢。 所以此芯的选择是: 从底层架构开始,为智能体重新定义一颗 CPU,而不是拿通用芯片凑合。 自研的此芯P1,就是这块地基石。 孙文剑在台上透露了一个细节: 五年前定义P1的时候,他们把高性能 CPU 、兼容性极强的 GPU,和一颗「前瞻性」的NPU捏在了一起。 「五年前我们对这个芯片,还怀着一个忐忑的心情。」五年后,这颗6纳米的芯片被产业界拿去,用进了各行各业,忐忑变成了底气。 第二,实现端边云全域协同。 智能体不会只活在云上,也不会只活在端上。 一个真实的业务流程,可能前一秒在本地拆意图,后一秒调云端大模型补脑子,再下一秒回到边缘执行。算力一旦被割裂在不同架构、不同生态里,协同就是句空话。 此芯的解法,是坚持了多年的「 一芯多用 」: 一颗高性能智能体CPU,配上不同的操作系统、不同的大模型和软件,打进消费、工业、车载、边缘四大计算场景。 再往前一步,就是这次战略里更大的那句话—— 以自研此芯P1为核心,打造覆盖端、边、云全场景的全域算力底座,真正实现

2026

twitter-meng shao资讯

No DeepSeek V4 Pro, no MiniMax M3 ?

No DeepSeek V4 Pro, no MiniMax M3? SemiAnalysis: CHINA’S KIMI K3 HAS SURPASSED ALL AMERICAN MODELS IN FRONT-END CODING WHILE BEING SMALLER THAN MOST CLOSED-SOURCE FRONTIER MODELS. Great work by the @Kimi_Moonshot team.

2026

twitter-Greg Brockman资讯

GPT-5.6 Sol is the state of the art in cyber. Seeing significant results in applying it to finding and fixing novel vulnerabilities. Sign up as a defe...

GPT-5.6 Sol is the state of the art in cyber. Seeing significant results in applying it to finding and fixing novel vulnerabilities. Sign up as a defender to use it to secure your systems: AI Security Institute: On our cyber range "The Last Ones", GLM-5.2 matches Opus 4.5, released ~7 months before it, while DeepSeek’s V4-Pro falls below Sonnet 4.5, from ~7 months before it.

2026

aibase资讯

2. 8 万亿参数、 100 万词元上下文,Kimi K3 把开源大模型的天花板顶到了全球最高

世界人工智能大会还没开锣,国产大模型就先放出一颗重磅炸弹。2026世界人工智能大会暨人工智能全球治理 高级 别会议即将举行之际,月之暗面于16日正式发布新一代模型Kimi K3,参数规模达到2.8万亿,一举坐上目前全球参数 最大 开源模型的交椅。这不仅是一次数字上的登顶,更意味着开源阵营 第一 次在体量上把闭源巨头甩在了身后。 Kimi K3不是只靠堆参数撑场面。北京月之暗面科技有限公司介绍,这款模型原生支持视觉理解,并具备100万词元的超长上下文窗口,相当于一口气吞下整本专著还能记得开头写了什么。它被针对性地优化用于软件工程、知识工作、深度研究、多模态理解等复杂任务场景,复杂任务的处理能力由此再上一个台阶——从读图识物到长程代码工程,K3试图把过去要拆成多步才能啃下的硬骨头,一把攥进同一个模型里。 资本端已经闻风而动。中信建投在研报中给出了一组颇具信心的判断:全球大模型调用量预计将连续11周环比走高,国产模型凭借高性价比稳稳占据流量前列,海外头部厂商的营收预期也被顺势上调。更值得玩味的是商业化节奏的此消彼长——国内厂商明显提速,DeepSeek准备推出分时定价,豆包已经上线多档会员;另一边,Anthropic收紧了Claude的访问限制,在合规与地缘因素的交织下,国产替代的逻辑被进一步照亮。 沿着这条主线,财联社主题库梳理出几家与之共振的上市公司。三六零在AI领域以360智脑与360安全大模型为核心布局,自研的千亿参数通用大模型360智脑已具备多模态理解、逻辑推理、代码生成等能力。昆仑万维则在7月2日宣布,旗下天工AI在2026年第二季度实现历史性突破,其AI Native模型与产品业务的年度经常性收入(ARR)已跨过8亿美元大关。当2.8万亿参数的开源巨兽落地,国产大模型的景气度,正被推向一个肉眼可见的新高点。