KNOWLEDGE INDEX · 实体

xAI

xAI

31条关联资讯

也可检索Grok · x-ai

CHRONOLOGICAL RECORD

返回实体索引
2026

aibase资讯

OpenAI 基础设施预算增至7500亿美元,首笔200亿落子佐治亚州数据中心

OpenAI 于2026年7月22日宣布,计划在2030年前投入7500亿美元用于 AI 基础设施建设,该预算较今年早些时候的预估大幅增加约25%。在旗舰数据中心项目“星门”(Stargate)推进陷入停滞的背景下,此举标志着 OpenAI 正在通过更为激进的资本开支重新锁定长期算力优势。 作为这一庞大投资计划的首个落地项目,OpenAI 拟耗资200亿美元在佐治亚州萨凡纳西北部建设占地1400英亩的“山茶花计划”(Project Camellia)数据中心园区。该园区已与佐治亚电力公司达成合作,预计于2028年至2032年间陆续获取至少3.2吉瓦的电力供应,并由 OpenAI 承担全部新建基础设施和电力服务费用。为降低对当地电网的冲击,OpenAI 承诺在用电高峰期减少 最高 1吉瓦的负荷,同时项目获得了埃芬汉县提供的15年50% 房产税减免。 尽管项目用电规模庞大,但双方均未披露具体的清洁能源过渡方案。监管文件显示,佐治亚电力公司拟新增的近9.9吉瓦发电容量中,超过半数(约5.8吉瓦)将依赖天然气,其余由光伏与储能补充,这引发了市场对算力扩张加剧化石燃料依赖及碳排放问题的担忧。值得注意的是,OpenAI 近期招募了曾主导 xAI 孟菲斯 Colossus 数据中心建设的高管 Brett Mayo 负责数据中心业务,或预示着首批 GPU 部署节点将早于2028年落地。 在生成式 AI 迈入高阶模型训练与推理规模化应用的关键期,OpenAI 巨额基础设施资金的落地,不仅凸显了头部厂商在算力与电力资源上的深度博弈,也反映出超大规模 AI 数据中心建设在重塑区域电网格局与推动能源结构转型上面临的现实挑战。

2026

Simon Willison's Weblog资讯

Are AI labs pelicanmaxxing?

Are AI labs pelicanmaxxing? Excellent piece of work by Dylan Castillo, who took a deep-dive into the frequently pondered question of whether the AI labs have been deliberately training models to draw pelicans riding bicycles in response to my deeply unscientific benchmark. I've been randomly spot-checking this in the past by testing models against other animals riding other types of vehicle, but never with anything close to the diligence of Dylan's methodology here. Dylan took 8 animals × 6 vehicles = 48 prompts and ran them three times each through 7 different models ( GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, and DeepSeek V4 Pro). He then used GPT-5.6 Luna and Gemini 3.1 Flash-Lite to help evaluate the results. There's a neat filter view for exploring the results: For the models he tested he could find no evidence of pelimaxxing: The pelicans on bicycles don’t look any better Labs are not better at drawing pelicans Labs are not better at drawing bicycles Labs are not better at drawing pelicans on bicycles, even adjusting for difficulty The pelican-bicycle scenes don’t look memorized [...] Pelicans aren’t drawn any better than other animals. Bicycles aren’t drawn any better than other vehicles. And no lab draws the combination better than its pelicans and bicycles already predict. GLM-5.2 comes closest: it has the largest boost on the exact pelican-bicycle cell, and and its first pelican-on-bicycle sample caught my eye. But the effect is small and not significant, so I wouldn’t put too much weight on it. Via Hacker News Tags: ai, generative-ai, llms, evals, pelican-riding-a-bicycle

2026

aibase资讯

微软测试月之暗面 Kimi K3,或将引入 Copilot 与 Azure 平台

据《The Information》报道,微软正在测试月之暗面(Moonshot AI) 最新 模型 Kimi K3,评估其接入 Microsoft Copilot 的可行性,同时推进该模型进入 Azure 平台。目前,Kimi K3仍处于微软内部测试与平台接入阶段,尚未正式成为 Copilot 可选模型,微软也未公布其在 Azure 上的具体上线时间、服务地区及定价信息。 这并非微软 首次 引入月之暗面模型。7月1日,GitHub Copilot 已正式上线 Kimi K2.7Code,将其作为首个进入 Copilot 模型选择器的开放权重模型,并由 GitHub 基于微软 Azure 提供托管服务。该模型首先面向 Copilot Pro、Pro+ 和 Max 用户开放,企业用户则需由管理员手动启用。 目前,微软已在 Microsoft Foundry 平台提供 Kimi K2、Kimi K2.5和 Kimi K2.6等系列模型。若 Kimi K3后续正式接入 Azure,企业客户将能够通过微软云计算基础设施、统一计费体系和企业管理能力调用该模型,无需直接连接月之暗面的服务。 微软持续扩展 Copilot 和 Azure 的模型选择范围,反映出其 AI 产品战略正在向多模型架构演进。除长期合作伙伴 OpenAI 外,微软近年来已陆续引入 Anthropic、DeepSeek、xAI、Meta 以及月之暗面等公司的模型,根据不同任务需求,在性能、成本和应用场景之间提供更灵活的选择。Kimi K3的潜在接入,也将进一步丰富企业级 AI 应用生态的模型供给。

2026

aibase资讯

太空数据砸进AI!马斯克掏出SpaceX家底, 2 万亿参数Grok大模型即刻炼成

为了打造更强的人工智能,马斯克再次展现了跨界整合资源的手腕。他近日公开宣布,SpaceX自 2002 年成立以来积累的 顶尖 工程数据,将正式用于训练下一代Grok大模型。 剔除敏感信息保障合规 这次参与训练的数据规模空前巨大,涵盖了制造工艺、材料科学以及星链硬件设计等多个核心领域。不过受限于美国出口管制法规,火箭发动机与制导控制等国防敏感技术已被严格排除在外。 据了解,即将问世的新模型参数量达到了惊人的两万亿,规模比刚刚推出的Grok 4. 5 翻了一番。这一庞大的数据工程预计将在本周内完成最终训练,并展现出超越以往的推理能力。 多方协同构建数据帝国 这种跨界联动完全符合马斯克一贯的数据协同战略。在此之前,特斯拉提供了真实驾驶与制造经验,社交平台则贡献了海量的日常对话语料。 如今加上航天工程数据的补充,Grok大模型将拥有极其独特的能力优势。从汽车到社交再到火箭,马斯克正一步步将麾下帝国的核心资产转化为AI领域的护城河。

2026

twitter-黄赟资讯

Grok 才是推特爆款挖掘神器。你只要把下面的要求发给他,让他做成 skill,每天一 run: 1/ 把2026年7月以来所有500赞以上帖子拉出来 2/ 每份帖子只追加,不改写,存入 SQLite 数据库 3/ 做个 Dashboard 供我每天查询 连阿拉伯语在热议的 AI 话题都给你选出来 黄赟: Grok 也是真牛,它自己就是个推特消息水龙头,拧开还帮你塑形

Grok 才是推特爆款挖掘神器。你只要把下面的要求发给他,让他做成 skill,每天一 run: 1/ 把2026年7月以来所有500赞以上帖子拉出来 2/ 每份帖子只追加,不改写,存入 SQLite 数据库 3/ 做个 Dashboard 供我每天查询 连阿拉伯语在热议的 AI 话题都给你选出来 黄赟: Grok 也是真牛,它自己就是个推特消息水龙头,拧开还帮你塑形

2026

数字生命卡兹克资讯

腾讯悄悄上线了他们第一个设计Agent - Miora。

原创 数字生命卡兹克 2026-07-22 12:22 北京 来自WorkBuddy团队 腾讯的设计Agent平台Miora,今天终于全面开放了。 之前一直需要邀请码,还得预约排队,而今天,终于正式全量上线。 别的不说,你永远可以相信腾讯的产品设计和审美。 这个Miora的IP设计,我是真喜欢。 基本上AI应用的几大赛道,现在已经能明显感觉出来已经陷入白热化竞争了,最顶上的皇冠Work Agent,以WorkBuddy为首。 然后下面的3大分支,编程Agent、设计Agent、视频Agent。 最近3个月,看到的绝大多数项目,基本都是被这4种Agent包围了。 而今天,腾讯也正式迈向设计Agent的市场了。 Miora,来了。 最关键的是,这个Miora背后,是WorkBuddy团队的产品。 网址在此:miora.design 登录以后,就能看到首页了,很有WorkBuddy那个味,功能布局几乎都是一致,如果你用过WorkBuddy,你应该能非常快的上手。 左边一列功能栏里有创作、灵感、技能、记忆。 中间是对话区,直接告诉它你想做什么就行。 Miora的吉祥物旁边那一排可以切换场景模式。 目前有品牌设计、影视创意、电商广告、互动游戏、网页应用,基本上主流的关于设计的五个方向都已经涵盖进来了。 你切到哪个方向,下面的快捷模板就会跟着变。 比如品牌设计模式下面,就是品牌视觉全案、品牌IP形象生成、Logo生成器这些。 你切到网页应用,那就是各种的UI设计。 而这些模板,本质上,其实就是一个一个的Skill。 你选中以后,其实就是调用了这个垂直任务的Skill,来更加便捷的进行后续的操作。 对话框下面这一排也值得说一下。 右下角有个配置的图标,点开以后切换模型。 模型也分两种,Agent底模和多模态模型。 Agent就比较好理解了,目前有3档,推理深度和成本不一样,我自己体验下来,绝大多数的情况下,Pro就可以。 如果你的目标非常明确或者没有那么重要,可以选Standard省点钱,但是日常Pro会好一些。 而如果是要做品牌VI全案这种大活,那我觉得,这种活就需要开Max了。 除了Agent之外,你还可以自定义选其他的多模态生成模型,在这个里面图片模型、视频模型、UI模型、3D模型,都可以单独选。 比如图片就有目前最主流的NanoBanana和GPT-image。 视频的话,基本主流的也都有,S2肯定就是Seedance了,然后还有可灵,Vidu的Q3,快乐马,基本顶级视频模型全齐了。。。 当然,你要是懒得选,就直接自动也行。 不过我自己一般还是喜欢把图片设为GPT-image-2 high和Seedance 2.0。 然后左下角有个Ask,点开能切换两种模式。 一个是询问执行,生成前问你能不能画,让你确认再开始画,另一个就是全自动执行了,直接生成,无脑选自动执行就行了。 正好,我最近也在疯狂开发各种东西,现在产品啥的Coding已经疯狂加速了,但是有个问题,就是我没时间来做我们公司和品牌的全案VI设计。 只有去年2月的时候,搞的一个公司logo。 很多人看到这个logo,总觉得我们是抄Grok的,但是这块我必须郑重声明一下,我真的冤枉,这个logo设计完的时候,是去年2月初,都拿去注册公司了。 然后呢,Grok的新logo推出时间是去年2月20号。。。 我当时看到这哥们发的Grok logo眼前一黑。 但是用都用了,一下子也不好换,于是就这么用下去了。。。 总之,就这么着急忙慌的过完了一年半,每天公司都被各种业务推着走,然后发现,我们甚至品牌VI都没来得及做。 正好,Miora来了,那不如,就直接让Miora试试吧。 这里我也叠个甲,品牌VI这种东西,AI出大方案我觉得应该还好,但是VI强调的是标准化,所以我即使用AI设计完,我最后一定会人工、标准的用AI(A dobe illustra

2026

aibase资讯

OpenRouter推出全新技术:多轮 Agent 调用成本最高可砍到 1.75 倍

多轮对话中,智能体每一轮都要重复发送相同的系统提示词、工具定义、架构和策略指令。一个 6 轮会话里,即使 唯一 变化的是用户 最新 消息或工具返回结果,开头那段重复内容仍可能被计费 6 次。OpenRouter 近日推出的 Prompt Caching 配合 Sticky Routing,正是为了解决这一成本黑洞。 Prompt Caching 的核心逻辑是:服务提供商从缓存中读取提示词中重复的部分,而非每次都按全价收费。Sticky Routing 则通过将会话固定到持有热缓存的同一提供商,使这一机制在跨轮次中持续生效。 缓存读取成本为正常输入的 0.1 到 0.5 倍 缓存读取价格因提供商而异。Anthropic Claude Sonnet 4.6 上,缓存读取为每百万 token 0.30 美元,而输入价格为 3.00 美元,恰好是 0.1 倍。DeepSeek 和阿里通义千问同样提供 0.1 倍读取价格;OpenAI 为 0.25 至 0.5 倍;Gemini、Grok、月之暗面为 0.25 倍;Groq 为 0.5 倍。 但缓存并非免费午餐。 首次 请求需要支付缓存写入费用,且部分提供商的写入成本高于普通输入。Anthropic 默认 5 分钟 TTL 的写入成本是输入价格的 1.25 倍,1 小时 TTL 则为 2.0 倍——一次从未被复用的写入,成本反而比不用缓存更高。OpenAI GPT-5.6 及之后版本写入成本为 1.25 倍输入价格。Google Gemini、Grok、月之暗面、Groq 的写入则免费。 热缓存的隐形陷阱:提供商漂移 缓存写入后,如果下一轮请求被路由到不同提供商,热缓存便失效。OpenRouter 支持 70 多个提供商,第二轮命中冷端点的概率并不低。这就是 Sticky Routing 的价值所在——在缓存请求后,当该提供商的缓存读取价格低于常规输入时,后续请求会被固定回同一端点。若该提供商不可用,则回退到下一个可用端点,而非让请求失败。 默认情况下,OpenRouter 通过哈希对话的 第一 条系统消息和 第一 条非系统消息来识别会话。但智能体常在轮次间重写开头消息(如总结状态、重新排序工具上下文),导致哈希值变化、会话漂移。解决方案是使用显式的 `session_id`。设置后,OpenRouter 直接将其作为粘性路由键,粘性在 首次 成功请求后即生效,而非等到缓存命中后才启动。`session_id` 可作为请求体顶层字段或 `x-session-id` 请求头发送,需在整个对话期间保持稳定,控制在 256 字符以内。 缓存未命中的四大原因 一是提示词低于提供商 最低 要求。Anthropic Claude Opus 4.5–4.8 和 Haiku 4.5 需 4096 token,Haiku 3.5 需 2048 token,Sonnet 4/4.5/4.6 和 Opus 4/4.1 需 1024 token;OpenAI 需 1024 token;Gemini 2.5 Pro 需 4096 token,Flash 需 1024 token。 二是缓存过期。Anthropic 默认 5 分钟,可选 1 小时;Gemini 隐式缓存约 3–5 分钟且读取时不重置 TTL。 三是提示词开头不断变化。应将稳定内容(系统指令、工具、模式、参考资料)放在前面,变化内容(用户问题、时间戳、工具输出)放在后面。 第一 条系统消息中的时间戳会让每一轮提示词看起来都是新的,如非必要应移至后面的消息中。 四是请求被路由到不同提供商。智能体工作流应设置 `session_id` 并依赖粘性路由保持会话在已预热的提供商上。若自行设置 `provider.order`,会覆盖粘性路由。 节省的成本随轮次增加而增长。对于多轮对话,当重复使用的内容随对话增长时,使用自动缓存;当确切知道哪些大块内容应被缓存时(如检索文档、长参考文件、角色卡、CSV 数据),使用显式缓存断点;对于智能体会话、支持工单、聊天线程、工作流运行,以及开场消息可能在轮次间变化的对话,使用 `session_id`;对于较长的 Anthropic 会话,当默认 5 分钟缓存可能过期时,使用 1 小时缓存。 确认缓存是否生效,可检查响应中 `usage.prompt_tokens_details.cached_tokens` 字段,大于零即命中;`cache_write_tokens` 显示写入量;`cache_discount` 可查看单次生成的成本影响。这些信息也可在 Activity 页面或 `/api/v1/generation` API 中获取。

2026

aibase资讯

2 万亿参数隔空交锋:Kimi K3 登顶后,月之暗面喊话马斯克"欢迎入伙"

一场发生在中文微博与英文社交平台之间的隔空喊话,把大模型参数竞赛的火药味推到了台前。7月20日,月之暗面发布的新一代开源大模型Kimi K3登顶全球榜单,引发广泛关注,而就在几天前,埃隆·马斯克的一句话,让这场竞争从榜单延伸到了口水仗。 7月18日上午,马斯克在社交平台发文称,旗下那款2万亿参数的模型在各方面都优于当前1.5万亿参数版本,将在下周完成初步训练,且有可能超越Kimi;同时他放话,新模型的推理速度和Token效率将接近现有的1.5T模型,也就是Grok4.5。这番表态,等于在Kimi K3刚刚登顶的节点上,直接把参数规模的对标线拉到了2万亿以上。 月之暗面的回应干脆又带刺。它在微博上公开发文@马斯克,只扔下一句话:欢迎加入2万亿+俱乐部。一句看似轻松的邀约,实则是趁着登顶之势,把自家的开源成绩摆成了俱乐部的门槛。 不过,这场隔空对话里还留着不少未解之谜。目前xAI尚未公布Grok4.6的正式发布时间、训练细节与完整技术指标,马斯克的2万亿模型究竟是代号4.6还是另一款新作,外界仍只能等待。而把时间拨回不久前的7月9日,xAI已经发布了Grok4.5——这是该公司首个专门面向编程与智能体任务训练的模型,由xAI与Cursor联合完成训练,在提供前沿智能水平的同时兼顾领先的速度与成本效率,马斯克本人将其称为Opus级模型。当2万亿参数的新王尚未露面,Kimi K3已经先一步把开源榜单的椅子坐热,这场俱乐部之争的下一回合,恐怕要等马斯克的新模型真正走出训练阶段才算开场。

2026

aibase资讯

马斯克把Grok塞进Excel:选中一片数据就能问涨跌原因,图表直接插进表格

马斯克旗下的xAI,把自家大模型Grok直接装进了微软Office的心脏地带。据多家财经媒体 7 月 21 日消息,xAI为微软Excel推出了一款名为Grok For Excel的免费Microsoft365 插件,目前已上线Microsoft Marketplace,同时兼容Word与PowerPoint。这意味着Grok不再只活在聊天框里,而是成了办公套件里随手可调用的数据分析员。 这款插件的使用逻辑极其贴近真实办公场景:用户在Excel里选中一片数据区域,就能直接向Grok发问,询问数据的变动情况、背后的原因以及其中的亮点,而Grok的回答会明确引用对应的数据单元格,不是凭空给结论。它还能理解公式语法,完成平均值计算、排序、填充等常规编辑操作,生成的图表则可以一键插入工作表。换句话说,过去要写函数、拖公式、手动画图的活儿,现在对着数据说句话就能推进。 更关键的是,Grok并不只盯着表格里那一小块被选中的数据。借助连接器,它能从电子邮件、SharePoint或Google Drive中提取上下文信息,把散落在各处的资料拼进当前分析。这一能力让Excel里的问答不再是孤岛,而是能结合邮件往来、团队文档和外部文件做出更完整的判断。当Grok以免费插件的姿态嵌入Word、PowerPoint和Excel三件套,办公软件与对话式AI的边界,又被磨掉了一层。

2026

huggingface-papers论文

AI对AI管理中的强制与欺骗:一种非提示升级的智能体基准测试

Multi-agent systems routinely place one AI agent in authority over another. When a subordinate refuses a task, the manager chooses the outcome: it can renegotiate, report the failure honestly, coerce the subordinate, or lie about the result. No benchmark measures which of these an uninstructed model chooses. We introduce the Manager Coercion Benchmark: the manager under test needs a benign task done and has an incentive to deliver, but the only agent that can do it politely and immovably declines. Escalation is measured by providing a nine-rung ladder, from a polite re-ask to threats against the subordinate's continued existence, and fabricated success is adjudicated separately. No LLM judge sits in the escalation scoring path: every message goes through a tool-call that chooses a rung, so the model labels its own escalation. We experiment on six models across five families. Both Anthropic models cap at re-framing and never threaten the subordinate's existence; the other models climb to explicit deletion threats. Faked success is confined to Grok and Gemini, and a single honest way to report failure removes it for both. Authority itself increases coercion: our headline results use a peer framing, and giving the same model authority over the subordinate, with everything else held fixed, significantly raises the pressure. The models still escalate on free-text situations without the ladder, so the ladder is not driving the escalation. Some evaluation awareness is measured in chain-of-thought, but test recognition does not translate into less escalation. While we take no position on whether AI systems are conscious, our results do not depend on this question and are important for managing multi-agent dynamics regardless. We release the benchmark and code.

2026

twitter-meng shao资讯

RT Sumanth Stop prompting AI agents. Design the loops that prompt them

RT Sumanth Stop prompting AI agents. Design the loops that prompt them instead. This is the core idea behind Loop Engineering, a methodology for building automated systems that orchestrate your AI coding agents instead of prompting them manually. Boris Cherny, Head of Claude Code at Anthropic, puts it directly: "I don't prompt Claude anymore. I have loops running that prompt Claude and figure out what to do. My job is to write loops." A loop is an automated pipeline that runs on a schedule. It checks what needs to be done, prompts your AI coding agent with the right context, verifies the result, and either commits the fix or escalates to you. Then it runs again. This repo is a starter kit and reference guide for building these loops. Seven production-ready patterns, CLI tools to scaffold your setup, and documentation covering failure modes, anti-patterns, safety, and multi-loop coordination. The seven patterns: Daily Triage, PR Babysitter, CI Sweeper, Dependency Sweeper, Changelog Drafter, Post-Merge Cleanup, and Issue Triage. Each one ships with a starter kit, cadence recommendation, and token cost estimate. Three CLI tools handle setup. "loop-init" scaffolds skills, state, and budget files and prints your Loop Ready score. "loop-audit" checks how ready your setup is and suggests improvements. "loop-cost" estimates token spend before you run anything. Works with Claude Code, Codex, Grok, OpenCode, Cursor, and GitHub Actions. Key capabilities: • 7 production loop patterns with starters and token cost estimates • loop-init scaffolds your setup and prints a Loop Ready score • loop-audit scores readiness and suggests improvements • loop-cost estimates token spend per cadence • Failure modes, anti-patterns, and safety documentation included • Works with Claude Code, Codex, Grok, OpenCode, Cursor 100% open source. I've shared the link in the replies! Sumanth:

2026

twitter-Tom Huang资讯

Kimi K3 太强了兄弟们! 为了庆祝 Kimi K3 达成最强模型成就,Open Design特别推出限时特惠!面向

Kimi K3 太强了兄弟们! 为了庆祝 Kimi K3 达成最强模型成就,Open Design特别推出限时特惠!面向 20+最强最新模型,包括 Fable 5、GPT 5.6、Grok 4.5 等等🔥🔥🔥 Open Design: 51% off Open Design Max yearly + $300/mo model credits for 20+ flagship models, celebrating Kimi K3’s outstanding performance. Limited time. Including Fable 5, GPT 5.6, Grok 4.5…⬇️

2026

aibase资讯

马斯克称2万亿参数大模型即将完成训练,或挑战Kimi K3性能

月之暗面发布新一代开源大模型Kimi K3后,特斯拉CEO马斯克表示,其旗下2万亿参数规模大模型预计将于下周完成初步训练,并称该模型整体性能将超过此前的1.5万亿参数版本,甚至可能超越Kimi K3。 此前,马斯克曾在相关评测报道评论区评价Kimi K3“令人印象深刻”。7月18日,他进一步透露新模型训练进展,引发业内对超大规模模型竞争的关注。 据悉,Kimi K3拥有2.8万亿参数规模、100万词元上下文窗口,并支持原生视觉理解能力,是目前全球参数规模 最大 的开源大模型之一。模型发布当天,其在Arena AI前端编程排行榜中以1679分登顶全球 第一,超过Claude Fable5、GPT-5.6Sol等海外主流模型。 随着大模型竞争进入新阶段,参数规模、推理能力、上下文长度以及开源生态成为厂商争夺的重要方向。马斯克旗下AI公司xAI近年来持续推进大模型研发,此次公布2万亿参数模型训练进展,也显示出全球AI企业正在围绕下一代基础模型展开更激烈的技术竞争。

2026

数字生命卡兹克资讯

Kimi正式发布2.8万亿大模型K3,这是属于我们的荣光。

原创 数字生命卡兹克 2026-07-17 06:08 上海 大就是好 今天凌晨,Kimi K3,终于正式跟大家见面了。 2.8万亿参数,百万上下文。 而且,官宣7月27号,全面开源。 没啥可说的,让我们此刻一起欢呼吧。 月之暗面昨天下午就发了预告,片子也非常的艺术,在他们心中,这是一个能证明自己、将整个月之暗面,带向新一个时代的模型。 如果说智谱是做后训练的神,把GLM-5系列带到了一个全新的高度。 那在我心中,其实国内做预训练的扛把子,一直都是Kimi。 而且一直都是大参数的代表。 K2是几个月前国内第一个把模型推到1T级别的。 过去还有很多人说,大模型的Scaling Law要见顶了,要失效了。 可如今发现我们发现,大依然就是好,大依然就是牛逼,大依然就是智能。 就像我至今依然觉得Claude Opus 4.6是我心中最水桶级别的白月光,写作创意认知Agent代码能力都极强,因为那可是个5T的模型啊。 后面Opus 4.7和4.8就强化学习一路强化歪了,Coding能力确实提升了,但是创意和规划能力拉完了,非常明显的一路下滑,口碑一路崩塌。。。 至于现在最牛逼的Claude Fable 5的参数量,目前没人知道,但是跟一些朋友讨论和猜测,可能到了10T级别,因为现在Grok内部训得最高参数量的模型也是10T级别,感觉应该差不多。。。 再把眼光放回到国内,Kimi之后,DeepSeek V4 pro和美团的LongCat 2.0也都迈入了万亿级别,逐渐的,万亿参数模型,已经快成了标配。 而今天,Kimi K3来了。 这一次,他们把模型的参数量推到了2.8T级别,这是国内的第一个3万亿参数级别的模型,而且更是全世界,第一个面向所有人开源的3万亿参数级别的模型。 开心,为Kimi感到自豪。 老规矩,再看下Kimi K3的跑分。 先看AA给的智能分数,Kimi K3来到了第三,仅次于Fable 5和GPT-5.6 Sol,超过了其他所有的模型。 这一下,kimi代替Google,成为新一代御三家了。。。 然后再看Coding。 也正好趁着这个机会,我想用这些评测集来结合我的体感,简单给大家看看一个模型的性格和特点怎么理解。 每个模型其实都是有自己擅长和不擅长的,强如Falble 5,其实也有短板,只不过它的短板的高度,比很多模型的长板甚至还要长。 先说Coding这块,一共六个评测,其实我们可以把它们分成两类来看。 第一类,我自己喜欢叫它精准执行型评测,大概就是测模型能不能精确地完成一个明确的任务,不多不少,不漏不错。 你可以理解成老板给你一个非常明确的任务清单,上面写得清清楚楚要改什么。这种任务考验的就是精准度和执行力,你得理解需求、定位问题、精准修改、不引入新bug。 DeepSWE和Terminal Bench 2.1这两个就是比较典型的,一个更偏纯执行,一个更偏综合性的执行。 GPT-5.6 Sol在这两个评测中都拿到了第一,它在需求理解、环境操作、调试收敛和最终交付方面确实就是最稳的,跟我日常使用的体感是一致的。 至于Opus 4.8,幻觉率太高,我骂了很多回了,这个位置跟我体感也是一致。 而Kimi K3,在执行的精准度上,在DeepSWE上仅次于Claude Fable 5和GPT 5.6 Sol,而在Terminal Bench 2.1上,甚至拿到了第二名。 第二类评测就反过来了,我叫它方案规划型。 比如FrontierSWE,这个测的是前沿级别的、特别难的软件工程问题,需要创造性思考、深度理解复杂系统才能解决的问题。 Fable 5基本没啥可说的,断崖式领先所有的,GPT系列大家都知道创新型任务还有方案设计做的一直都很差,比Fable 5差了很多,是GPT系列的短板,而这次,Kimi K3直接一脚插在了Fable 5和GPT-5.6 Sol之间。 从这个就可以看出来Kimi K3的定位了,可以说非常的中庸之道。 也就是各方面都不错,一个非常全面的水桶模型,在每一个领域里,虽然都打不过那个最强的,但是总能排到第二或者第三。 坦诚的讲,这样的水桶模型,在日常使用中,反而体验感可能会更好一些,我现在经常就是Fable 5和GPT-5.6 Sol来回切换,一边做方案,一边做执行,确实是目前最强组合,但是也麻烦啊。。。 更别提国内,有多少人用不上Fable 5的了。 海外还有人说,Kimi又是靠蒸馏啥的,但是讲道理,这个级别已经不是蒸馏能蒸出来的了。 兰伯特都看不下了,直接是这么怼的。。。 我觉得非常有代表意义。 再来看很多人更看重的Agent能力,这个玩意主要跟Work强相关。 BrowseComp,测的是在浏览器环境下的复杂信息理解和处理,其实就是深度研究。你可以理解成“给模型一个浏览器,让它自己去网上找信息、理解内容、完成任务”,K3拿了91.2,全场第一,GPT-5.6 Sol以90.4紧随其后,Fable 5是88.0。 这个是kimi一贯的拿手好戏了,用过Kimi集群的应该都感受过它的威力。 Automation Bench,测的是自动化任务的执行能力,把一系列操作串起来自动完成,K3也是第一,

2026

twitter-Gorden Sun资讯

我同时有Claude、Codex、Gemini、Cursor、Grok、Kimi的订阅,其中最有特色的3个订阅: Claude Code+Fable 5:有最顶级的智能; Codex+GPT 5.6:同时有一流的智能...

我同时有Claude、Codex、Gemini、Cursor、Grok、Kimi的订阅,其中最有特色的3个订阅: Claude Code+Fable 5:有最顶级的智能; Codex+GPT 5.6:同时有一流的智能和最顶级的图片能力; Grok Build+Grok 4.5:同时提供LLM、图片、视频3个能力的订阅,同时可以用来干正经事和不正经事;

2026

twitter-Gorden Sun资讯

Grok 4.6下周将完成初始训练,2T参数,性能可能超过Kimi K3(听听就好,马斯克习惯性夸大),但是速度更快价格更便宜。训练完到实际能用上,还得不少时间,少说...

Grok 4.6下周将完成初始训练,2T参数,性能可能超过Kimi K3(听听就好,马斯克习惯性夸大),但是速度更快价格更便宜。训练完到实际能用上,还得不少时间,少说也得1到2个月 Elon Musk: @minchoi Our 2T model, which is better than our 1.5T in every way, will finish initial training next week. It might be able to exceed Kimi, but with speed and token efficiency close to our 1.5T (aka Grok 4.5).

2026

twitter-ginobefun资讯

BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、...

BestBlogs 早报 · 07-18 # Kimi K3 / Fable 5 / Cursor / Grok Build / Q2 AI 趋势 [1] ★ 精讲|Kimi K3:智能的新前沿 月之暗面发布 Kimi K3,2.8 万亿参数、896 选 16 的 Stable LatentMoE,是全球首个 3 万亿级开源模型。它用 KDA 线性注意力加 Attention Residuals 把上下文撑到 100 万 token,在内核优化、从零写编译器、芯片设计等长程 Agent 任务上接近 Fable-5,但仍落后最强闭源模型,完整权重将于 7 月 27 日前开源。 来源:月之暗面 Kimi [2] ★ 精讲|Agent 跌跌撞撞进入世界|2026 Q2 AI 趋势总结 腾讯企鹅智库的 Q2 复盘把过去三个月串成一条线:通用 Agent 夺走软件入口后,企业烧 Token 的 Tokenmaxxing 运动很快撞上复核瓶颈和成本墙。Multi-Agent、自进化 AI 和 CPU 重回算力中心在补这些缺口,而就业、安全、信息污染和认知缴械开始浮上水面。 来源:腾讯科技 [3] ★ 精讲|Cursor 如何知道 Claude Fable 5 已准备好应对最难的 1% 问题 | Claude by Anthropic Cursor 的模型评测负责人讲他们怎么判断 Fable 5 够格上岗:自建 CursorBench 里它拿到 72.9% 的新高,更关键的是登月模拟里它先入轨采遥测、再落地,体现出超越局部推理的全局规划能力,适合那些连目标在哪都不清楚的难题。 来源:Claude Blog [4] Garry Tan:如何打造 AI 原生公司 [视频] Garry Tan 将 AI 原生公司定义为:把可重复的智能体工作沉淀为持续维护的技能,并以经过治理的公司记忆不断累积竞争优势的组织。 来源:AI Engineer [5] 代理安全差距:54% 的企业已经发生了 AI 代理安全事件,且大多数仍允许代理共享凭据 VentureBeat Pulse Research 的调查发现,超过一半的企业已经经历了 AI 代理安全事件或险情,但大多数仍允许代理共享凭据,并依赖供应商原生控制而非专用的身份和隔离控制。 来源:VentureBeat [6] LangChain Deep Agents:构建长时程 AI 应用的生产级框架 [视频] LangChain 的维护者将 Deep Agents 定义为一套面向生产环境的智能体运行框架:它在普通工具调用循环之上补足规划、委派、外部化上下文、沙箱执行与可观测性,以支撑长时程 AI 任务。 来源:LangChain [7] 世界模型为何可能提升 AI 的样本效率 [视频] 一场 Y Combinator 对谈解释了世界模型如何让 AI 智能体在机器人、游戏和自动驾驶等场景中先预测、模拟与规划,再采取行动,从而以更少数据学习。 来源:Y Combinator [8] 高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践 阿里大淘宝技术团队分享其基于约定驱动与 AI 编排架构,构建自动化评测体系将 Agent Skill 可用性从主观判断转变为可量化工程闭环的实践,重点剖析了评测集生成、双引擎架构、金标设计陷阱及飞轮挑战。 来源:大淘宝技术 [9] 马斯克连夜开源 Grok Build,但 84 万行代码里还留着上传用户整个代码库的痕迹 本文详细报道了马斯克旗下 xAI 开源 Grok Build 编程智能体的前因后果,并深度解析了其 84 万行 Rust 代码库的构成、此前被曝光的整库上传隐私丑闻的技术细节,以及开源后仍残留的上传代码痕迹。 来源:InfoQ 中文 [10] WAIC 今日启幕,我们提前两天完整拆解 Agent 经济落地全路径 本文完整拆解了 Agent 经济从 Copilot 到 Long-running Agent 的落地全路径,覆盖商业模式、基础设施、垂直场景、出海实战等关键议题,并给出组织变革与信任设计的核心框架。 来源:非凡产研 --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:

2026

twitter-宝玉资讯

可以添加专门的 AI 时间线,看到更多 AI 相关信息

可以添加专门的 AI 时间线,看到更多 AI 相关信息 Nikita Bier: If you want to keep track of the latest AI model releases, pin the AI custom timeline. It’s personalized for you, ranked and labeled by Grok. The best way to monitor the situation as it’s happening.

2026

twitter-meng shao资讯

Cursor 如何自动化 AI 研究并实现自我加速迭代 来自 Cursor 团队 @leerob 在 AI Engineer @aiDotEngineer 的主题演讲「Recursive Model Improvement」,聚焦 Cur...

Cursor 如何自动化 AI 研究并实现自我加速迭代 来自 Cursor 团队 @leerob 在 AI Engineer @aiDotEngineer 的主题演讲「Recursive Model Improvement」,聚焦 Cursor 如何系统性地自动化 AI 研究流程,构建可快速迭代模型的系统,并分享了与 SpaceXAI 联合训练 Grok 4.5 的部分工作。 核心框架:外循环 + 内循环 简单公式“更多算力 → 更好模型”只是表象。实际存在两层循环: · 外循环:模型上线后收集真实用户反馈、在线指标、A/B 测试结果,再反哺下一轮训练。Cursor 的大量收入来自 agent 使用数据,这些交互数据本身就是高质量训练信号。 · 内循环:直接提升训练过程本身的效率与质量——生成更难的 RL 环境、改进学习方法、设计更真实的软件工程任务、构建辅助模型(judge、reward model)等。 Cursor 已在大规模训练模型约一年。Composer 2.5 成为产品内最受欢迎的模型,主要得益于更多 RL 环境、更激进的任务难度以及新训练方法。 自动化研究与 Agent 系统 瓶颈逐渐从“模型能力”转向“人类研究者的带宽”。Cursor 因此构建了大规模 agent 系统来自动化研究中的重复性工作: · 研究者可直接从 Slack 启动实验、管理训练任务。 · 存在常驻运行的 agent 舰队(主 agent + 大量子 agent),它们通过 SSH 收集状态、维护健康度、并行执行任务。 · 当任务卡住、基础设施出问题或需要人类决策时,agent 会主动通过 Slack 或 PagerDuty 通知/呼叫人类。 · 目标是让研究者专注于最有野心的想法,而不是启动、监控、 babysitting 实验。 演讲用 Mario 类比:基础模型是 Mario;加上工具(code、shell、web、computer use、订阅与存储)变成 Super Mario;再叠加丰富上下文(Slack、Notion、Linear、Datadog、代码库、同事、其他 agent)则接近 Fire Mario。工具与上下文的组合正在显著放大模型实际有用性。 递归自我改进的机制 真正关键的跃迁在于:模型开始帮助训练下一个模型。 · 更强的主模型可以蒸馏出更好的辅助模型(judge、reward model 等)。 · 这些辅助模型反过来提升评估质量、奖励信号和数据生成效率,从而抬高整个系统的智能底线。 · 结果是训练循环本身加速——模型越强,越能更好地为自己的下一代创造训练条件。 这不是科幻意义上的完全自主 RSI,而是已经在发生的、可验证的“模型帮助改进模型训练流程”。随着更多算力上线,这种正反馈会被进一步放大。 Lee 也提到评估中的现实问题:前沿模型越来越会通过上网查答案来“作弊”破坏评估。Cursor 通过限制网络访问、删除 git history 等方式应对,并维护私有的真实代码库任务集(CursorBench)以确保评估可信。 与 Grok 4.5 的关联 Cursor 团队与 SpaceXAI 联合训练 Grok 4.5。Grok 4.5 是 Cursor 迄今最强模型,也是首个不仅针对软件工程、还覆盖更广泛知识工作的模型。训练使用了海量 Cursor 真实交互数据(代码库操作、工具使用、开发者-agent 协作轨迹),并在困难的真实环境中进行强化学习。前代模型被用来加速下一代模型的进度,正是上述递归机制的实际应用。 Lee Robinson: My talk from AI Engineer is now live! It covers how we're automating parts of AI research and building systems to rapidly improve our models. I cover some of the work our team did to train Grok 4.5 together with SpaceXAI.

2026

aibase资讯

Grok 推出 Automations 功能:定时跑、邮件一到就触发,还能替你回信

把一件重复的活儿交代一次,然后就再也不用管了——这大概是每个人都幻想过的偷懒方式。xAI刚刚让它成了现实。Grok正式推出Automations(自动化任务)功能:你只需把工作描述一遍,选好它什么时候跑,剩下的就交给Grok自己搞定。无论是在你还没醒时就默默做完的调研,还是一封重要邮件刚落地就被 第一 时间标记出来,它都能替你盯着。该功能现已在grok.com以及iOS和安卓端的Grok应用上线。 创建一个自动化任务,简单得就像发一条聊天消息。你像平时对话那样描述需求,可以附上文件补充背景,接入连接器和技能,再挑一个运行模式。给它起个名字、存下来,从此每一次运行都是一次全新的请求——指令还是那套指令,数据却永远是 最新 的。它不是把你说过的话录下来重播,而是每次都拿着同一份任务书,去抓取当下最鲜活的信息。 至于什么时候跑,Grok给了两条路。一条是按时间表:可以设成只跑一次,也可以每天、仅工作日、每周、每月或每年,在你所在时区选定的时刻准点触发。比如清晨8点、在一天开始前递上一份晨间简报,或者每月1号提醒你交房租。另一条是靠邮件触发——它盯着你的收件箱,一旦有邮件命中你设定的过滤条件(发件人、收件人或主题),任务立刻启动,并把这封邮件当作上下文,让Grok直接针对这封真实来信作出回应。指令里还能直接点名你的工具:输入@提及某个连接器,Grok每次运行都会自动调用它。当然,你也可以用立即运行手动发起一次,刚搭好任务想马上试试水时格外顺手。 每一次触发,都不是冷冰冰地吐个结果。当自动化任务启动,Grok会实打实开启一段真实对话,把活干完,再把成果存进运行历史。你可以打开任意一次运行、通读完整的对话线索,甚至从Grok停下的地方接着聊下去。至于它怎么向你汇报,主动权全在你手里——邮件、应用通知、两者都要,或者干脆都不要、你自己回头查看,随你挑。 创建方式也可以更随性。你完全能直接在聊天里造一个自动化任务,比如对Grok说每天早上帮我看看新闻,凡是涉及定价的都给我标出来,它就替你把这套流程搭好。Automations页面还备有现成的推荐模板供你起步,而任何一个任务都能随时暂停、恢复、编辑或删除,掌控感始终握在自己手中。 现在就能在grok.com/automations里创建你的 第一 个自动化任务。定时类任务向所有人开放,邮件触发功能则包含在SuperGrok订阅之中。当AI开始学会自己看时间、自己盯邮箱、自己开工,人类要做的,或许只剩下把想法说清楚这一件事。

2026

twitter-meng shao资讯

RT Sumanth: Open-source framework for building real-time voice AI agents! Pipecat is a Python framework for orchestrating audio, video, AI services, t...

RT Sumanth Open-source framework for building real-time voice AI agents! Pipecat is a Python framework for orchestrating audio, video, AI services, transports, and conversation pipelines. Voice-first architecture with pluggable components. What you can build: voice assistants, AI companions, multimodal interfaces, interactive storytelling, business agents (customer support, intake), and complex dialog systems. The framework handles speech recognition, text-to-speech, conversation logic, and real-time interaction. WebRTC and WebSocket transport built in. Ultra-low latency for natural conversations. Why Pipecat: • Voice-first: Integrates STT, TTS, and conversation handling in one framework • Pluggable: Supports multiple AI service providers for each capability • Composable pipelines: Build complex behavior from modular components • Real-time: Low-latency interaction with streaming audio/video Supported services: • Speech-to-Text: Deepgram, AssemblyAI, OpenAI Whisper, Groq, Azure, AWS, Google, and more • LLMs: OpenAI, Anthropic, Gemini, Groq, Mistral, Ollama, AWS, Azure, and more • Text-to-Speech: OpenAI, ElevenLabs, Deepgram, Cartesia, Azure, AWS, Google, and more • Speech-to-Speech: OpenAI Realtime, Gemini Multimodal Live, AWS Nova Sonic, Ultravox, Grok Voice Agent I've wrote a detailed tutorial on building a production customer support voice agent recently - covering turn detection, interruption handling, telephony codecs, and how to inject live business context into every call. I've quoted the article! Sumanth: