KNOWLEDGE INDEX · 实体

通义千问

Qwen

28条关联资讯

也可检索Qwen · 通义千问 · tongyi-qianwen

CHRONOLOGICAL RECORD

返回实体索引
2026

aibase资讯

OpenRouter推出全新技术:多轮 Agent 调用成本最高可砍到 1.75 倍

多轮对话中,智能体每一轮都要重复发送相同的系统提示词、工具定义、架构和策略指令。一个 6 轮会话里,即使 唯一 变化的是用户 最新 消息或工具返回结果,开头那段重复内容仍可能被计费 6 次。OpenRouter 近日推出的 Prompt Caching 配合 Sticky Routing,正是为了解决这一成本黑洞。 Prompt Caching 的核心逻辑是:服务提供商从缓存中读取提示词中重复的部分,而非每次都按全价收费。Sticky Routing 则通过将会话固定到持有热缓存的同一提供商,使这一机制在跨轮次中持续生效。 缓存读取成本为正常输入的 0.1 到 0.5 倍 缓存读取价格因提供商而异。Anthropic Claude Sonnet 4.6 上,缓存读取为每百万 token 0.30 美元,而输入价格为 3.00 美元,恰好是 0.1 倍。DeepSeek 和阿里通义千问同样提供 0.1 倍读取价格;OpenAI 为 0.25 至 0.5 倍;Gemini、Grok、月之暗面为 0.25 倍;Groq 为 0.5 倍。 但缓存并非免费午餐。 首次 请求需要支付缓存写入费用,且部分提供商的写入成本高于普通输入。Anthropic 默认 5 分钟 TTL 的写入成本是输入价格的 1.25 倍,1 小时 TTL 则为 2.0 倍——一次从未被复用的写入,成本反而比不用缓存更高。OpenAI GPT-5.6 及之后版本写入成本为 1.25 倍输入价格。Google Gemini、Grok、月之暗面、Groq 的写入则免费。 热缓存的隐形陷阱:提供商漂移 缓存写入后,如果下一轮请求被路由到不同提供商,热缓存便失效。OpenRouter 支持 70 多个提供商,第二轮命中冷端点的概率并不低。这就是 Sticky Routing 的价值所在——在缓存请求后,当该提供商的缓存读取价格低于常规输入时,后续请求会被固定回同一端点。若该提供商不可用,则回退到下一个可用端点,而非让请求失败。 默认情况下,OpenRouter 通过哈希对话的 第一 条系统消息和 第一 条非系统消息来识别会话。但智能体常在轮次间重写开头消息(如总结状态、重新排序工具上下文),导致哈希值变化、会话漂移。解决方案是使用显式的 `session_id`。设置后,OpenRouter 直接将其作为粘性路由键,粘性在 首次 成功请求后即生效,而非等到缓存命中后才启动。`session_id` 可作为请求体顶层字段或 `x-session-id` 请求头发送,需在整个对话期间保持稳定,控制在 256 字符以内。 缓存未命中的四大原因 一是提示词低于提供商 最低 要求。Anthropic Claude Opus 4.5–4.8 和 Haiku 4.5 需 4096 token,Haiku 3.5 需 2048 token,Sonnet 4/4.5/4.6 和 Opus 4/4.1 需 1024 token;OpenAI 需 1024 token;Gemini 2.5 Pro 需 4096 token,Flash 需 1024 token。 二是缓存过期。Anthropic 默认 5 分钟,可选 1 小时;Gemini 隐式缓存约 3–5 分钟且读取时不重置 TTL。 三是提示词开头不断变化。应将稳定内容(系统指令、工具、模式、参考资料)放在前面,变化内容(用户问题、时间戳、工具输出)放在后面。 第一 条系统消息中的时间戳会让每一轮提示词看起来都是新的,如非必要应移至后面的消息中。 四是请求被路由到不同提供商。智能体工作流应设置 `session_id` 并依赖粘性路由保持会话在已预热的提供商上。若自行设置 `provider.order`,会覆盖粘性路由。 节省的成本随轮次增加而增长。对于多轮对话,当重复使用的内容随对话增长时,使用自动缓存;当确切知道哪些大块内容应被缓存时(如检索文档、长参考文件、角色卡、CSV 数据),使用显式缓存断点;对于智能体会话、支持工单、聊天线程、工作流运行,以及开场消息可能在轮次间变化的对话,使用 `session_id`;对于较长的 Anthropic 会话,当默认 5 分钟缓存可能过期时,使用 1 小时缓存。 确认缓存是否生效,可检查响应中 `usage.prompt_tokens_details.cached_tokens` 字段,大于零即命中;`cache_write_tokens` 显示写入量;`cache_discount` 可查看单次生成的成本影响。这些信息也可在 Activity 页面或 `/api/v1/generation` API 中获取。

2026

aibase资讯

美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需

OpenAI前首席技术官穆拉蒂离开老东家后交出的 第一 份答卷,意外地把中美大模型的角色关系颠倒了过来。 7 月 15 日,她创办的Thinking Machines Lab发布 首款 模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还借了月之暗面Kimi K2. 5 等开放模型生成的合成数据。结果颇显微妙:在多项基准评测里,Inkling落后于Kimi和GLM,调用价格反而更高。一家融资 20 亿美元、估值 120 亿美元的明星公司,首秀多少低于预期,但穆拉蒂可能从一开始就没打算靠它争夺 第一。 单看硬件配置,Inkling确实撑得起明星实验室的排面。它采用混合专家架构,总参数量 9750 亿,每处理一个Token激活 410 亿参数;预训练用了 45 万亿Token,数据涵盖文本、图像、音频与视频,最长支持 100 万Token上下文;能理解文字、图片和音频,以文字形式输出,还支持通过调节思考强度在性能、速度与成本之间取舍。模型同时开放权重,采用相当宽松的Apache 2. 0 许可证,开发者既能下载权重自行部署,也能通过Thinking Machines旗下的Tinker平台微调。公司的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。 真正引人注意的,藏在技术报告的后半段。Thinking Machines在介绍架构时直接写道,Inkling的混合专家设计主要沿用了DeepSeek-V3,同样设置了大量专家模块、每个Token只调用其中一小部分,并采用了DeepSeek-V3 的无辅助损失负载均衡设计。中国模型的影响还延伸到了训练阶段:为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了Kimi K2.5。 一条完整的路线浮出水面——一家由OpenAI前CTO创办的美国实验室, 首款 模型沿用DeepSeek架构,又借助Kimi的数据完成后训练起步。借鉴开放模型本身无可厚非,DeepSeek和Kimi公开权重、允许使用,本就是建立在公开成果之上,更尴尬的是Inkling吸收了中国模型的技术之后,性能依旧没压过这些老师。Thinking Machines也坦然承认:Inkling并非目前表现 最强 的模型,无论开放模型还是闭源模型。 把数字摆出来就更清楚了。在人类最后的考试纯文本评测中,Inkling得29.7%,Kimi K2. 6 和GLM 5. 2 分别达到35.9%与40.1%;加上工具后Inkling升至46%,仍低于Kimi K2. 6 的54%和GLM 5. 2 的54.7%;考察真实软件工程能力的SWE-Bench Pro里,Inkling为54.3%,Kimi K2. 6 是58.6%,GLM 5. 2 达到62.1%;差距在Terminal Bench 2. 1 上最刺眼,Inkling仅63.8%,Kimi K2. 6 和GLM 5. 2 分别有71.3%和82.7%。 当然Inkling也有长项,在网页应用设计、音频理解和安全性评测中表现不错,部分数学任务还能超过Kimi和DeepSeek,但综合推理、编程与智能体能力,它暂时挤不进开放模型的 第一 梯队。价格同样没给惊喜:Tinker平台上64K版本每 100 万Prefill Token收费1. 87 美元、每 100 万Sample Token收费4. 68 美元,且这已是限时五折价,256K版本更分别涨到3. 74 和9. 36 美元;对比Kimi K2. 6 官方API输入0.95、输出 4 美元,GLM 5. 2 为1. 4 和4. 4 美元,Inkling的预填充价格接近Kimi K2. 6 的两倍,生成价格也更高,暂时看不出价格优势。于是局面变得有点微妙:架构参考DeepSeek,后训练借力Kimi,综合性能没超过中国头部开放模型,调用价格反而更贵。 之所以耐人寻味,在于Thinking Machines的特殊身世。这家公司几乎是OpenAI校友会—— 2025 年 2 月亮相时团队约 30 人,三分之二来自OpenAI,其余主要来自Meta和Mistral,创始阵容一度包括John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,路透社称穆拉蒂从前东家挖走了至少 20 名研究人员。 穆拉蒂本人 2018 年加入OpenAI,参与过DALL-E、Codex、ChatGPT和Sora, 2022 年升任CTO, 2023 年 11 月董事会罢免Altman后还短暂出任临时CEO,对OpenAI的模型研发与产品化路径有着完整认知。这样一群最懂OpenAI的人离开后,从零搭建技术体系,外界本期待一条带着OpenAI印记的路线,结果最明确的技术来源却指向中国模型,这很容易被解读成一个戏剧性信号:最了解OpenAI的一群人,最终选了中国模型的技术蓝图。 但这个结论需要拆开看。OpenAI近年前沿模型全部闭源,外界拿不到权重,也不了解完整架构与训练方案,穆拉蒂即便熟悉内部技术,也不能把前东家的商业机密搬进新公司;DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究复用。 Inkling本身也是开放权重模型,对想建设开放生态的公司来说,从DeepSeek、Kimi等开放模型吸收成熟方案,是顺理成章的工程选择。今天开发一款开放模型却完全避开中国团队已公开的成果,反而要付出更高试错成本。因此借鉴中国模型并不能证明穆拉蒂认为DeepSeek全面领先OpenAI,双方公开程度不同、可借鉴条件也完全不同,但它释放了一个清晰信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。 真正要回答的,是为什么Thinking Machines吸收了现成架构和训练经验,做出的Inkling却性能更弱、价格更高。穆拉蒂拥有 顶尖 团队、充足资金和英伟达 最新 训练系统,没有理由看不到这些差距,所以贵替很可能是一个经过计算的选择。 按Thinking Machines拿到的待遇,Inkling本不该只是一款够用的模型。 2025 年 7 月公司尚未推出任何产品,就完成 20 亿美元种子轮、估值 120 亿美元,投资方包括a16z、英伟达、AMD和简街;四个月后新一轮谈判目标估值一度高达 500 亿美元,虽未官宣,外界已把它视作OpenAI和Anthropic的潜在对手。当它以性能不如中国模型、价格还更贵的产品亮相,难免低于预期,但从商业角度看,穆拉蒂可能从一开始就没打算用它争基准 第一。 公司强调的是开放权重、多模态与可定制性,希望企业经Tinker微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准 第一 并不执着,企业更在意模型能否私有部署、能否掌握数据、能否按自己的业务继续训练。此前这类需求很大一部分被中国开放模型接住了:OpenAI和Anthropic长期闭源,Meta的Llama4 不及预期后也逐渐收缩开放路线,而DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型、价格却低得多。 美国企业很快用脚投票——OpenRouter向CNBC提供的数据显示, 2026 年 2 月以来,中国模型在美国企业经该平台调用的Token中每周占比都超过30%, 最高 一度达46%,而 2025 年上半年的平均占比还只有4.5%;Cursor开发Composer2 时测试多款基础模型,最终选了评测 最强 的Kimi K2.5,桥水基金则通过Tinker微调阿里的Qwen,以更低成本超过了部分 顶级 闭源模型。中国开放模型由此成了美国企业降成本的捷径,但这条路正在承压。 与此同时,美国对中国AI模型的监管氛围在收紧。相关部门已围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业受到调查。即便尚未形成统一限制,政策不确定性已足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。 这正是Inkling的市场空间:它是一款美国公司开发、采用Apache 2.0、支持私有部署和定制的开放权重模型,美国企业选它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。Inkling真正的价值,来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果,转化成一款由美国公司提供的模型,它不需要在基准里击败中国模型,只需成为那些不敢继续用中国模型的美国企业可以接受的选择,这也解释了它为何敢定更高的价:政策替它缩小了竞争范围,性能与价格的差距便没那么致命,对一些美国企业来说,一款稍弱、稍贵但风险低的模型,已经足够。 从这个角度看,Inkling反而证明了穆拉蒂懂做生意。但这套生意成立的代价,可能由美国企业承担。美国之外的公司仍可自由选择GLM、Kimi和DeepSeek,在更强更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品,基础模型的能力差距会继续传递到微调后的产品,最终形成结构性竞争劣势。华盛顿原本想用限制保护美国AI公司,结果可能先替Inkling这样的贵替创造了市场。对穆拉蒂来说,一般般已经够了,对美国AI产业来说,这份够用意味着成本升高与竞争力下降。

2026

aibase资讯

Anthropic Fable 5 训练成本三倍于开源模型,未来面临挑战

在最近的一次分析中,Wojciech Gryc 探讨了 Anthropic 的 Fable 5 与两款中国新模型的市场竞争情况。Moonshot 于 7 月 16 日推出的 Kimi K3 和阿里巴巴于 7 月 19 日发布的 Qwen 3.8 都达到了与 Fable 5 相似的性能,并且这两款模型将开源其权重。 Gryc 指出,训练前沿 AI 模型的主要成本来自研究人员和算力,但在模型训练完成后,推理成本才是真正的开销。每当用户调用 API 时,都会消耗大量的 GPU 资源和电力。他认为,如何支付推理成本将直接影响公司的商业模式。 他将 AI 公司分为三类: 第一 类是租用数据中心并支付电费的公司,如 Anthropic、Moonshot 和智谱(GLM 5.2);第二类是自建数据中心的公司,如 Meta 和阿里巴巴;第三类是拥有自发电能力和自建数据中心的公司,如 SpaceX。Gryc 强调,拥有基础设施的公司即使在模型性能上不是 最优,依然能通过出租服务器获得盈利。 此外,Gryc 指出 Anthropic 的 Fable 5 在单个任务的推理成本上几乎是 OpenAI 和开源模型的三倍。这样的高成本在竞争激烈的市场中是否能被用户接受,是一个值得关注的问题。他认为,当前市场上的基准测试已趋于饱和,用户对于模型的感知差异远低于成本差异,可能导致 Anthropic 面临被市场抛弃的风险。 与之相比,OpenAI 则凭借其全面的产品线和数据中心的布局展现出更强的市场竞争力。Gryc 预计,当前这一波竞争将持续发展,多家实验室可能会在未来不断超越传统的美国科技巨头。 划重点: 🌟 Fable 5 的推理成本是 OpenAI 和开源模型的三倍,面临市场压力。 🔍 Gryc 将 AI 公司分为三类,指出基础设施的重要性。 📈 竞争持续加剧,多家中国实验室正在快速追赶甚至超越美国公司。

2026

aibase资讯

消息称阿里将推出千问办公,整合三款智能体布局AI办公市场

7月21日,据《财经》报道,阿里计划推出“千问办公”产品,并已完成对旗下QoderWork、悟空、MuleRun三款智能体(Agent)产品的整合。该产品将成为阿里面向Agent办公市场的重要布局,负责推动企业办公场景中的AI应用落地。 据了解,千问办公由钉钉新任CEO陈宇森负责。今年6月,钉钉创始人、原CEO陈航卸任后,陈宇森接任相关业务。7月初,阿里将旗下三款Agent产品交由陈宇森统一负责整合,加速办公智能体业务协同。 从产品规划来看,千问办公将以QoderWork作为核心基础进行打造。业内人士称,QoderWork目前是阿里旗下用户规模较大、市场反馈较好的智能体产品;相比之下,悟空长期处于产品完善阶段,MuleRun此前主要面向海外市场,因此此次整合将以QoderWork为主要承载平台。 随着大模型技术快速进入办公领域,AI办公智能体正在成为互联网和科技企业竞争的新方向。相比传统办公软件,Agent产品能够通过理解用户需求、自主执行任务和调用工具,完成文档处理、信息整理、流程自动化等复杂工作。 阿里此次整合旗下多款智能体产品,意味着其正在进一步集中资源,打造统一的AI办公入口。未来,千问办公能否依托阿里云、钉钉以及千问大模型生态形成差异化竞争,将成为其在企业级AI应用市场中的关键看点。

2026

aibase资讯

阿里发布Qwen-Image-3.0,支持4.5K Token超长输入与复杂图文生成

阿里正式发布新一代图像生成基础模型Qwen-Image-3.0。作为千问图像生成与编辑系列的第三代基础模型,新模型支持 最高 4.5K Token超长文本输入,可一次性生成包含公式符号、几何图形、逻辑推导、多层UI界面等复杂内容,并原生支持12种语言和20余款字体渲染,进一步提升商业级图文内容生成能力。 相比上一代模型,Qwen-Image-3.0将文本输入长度提升至4.5倍,在影视分镜、知识图解、产品说明页等依赖长提示词的场景中,用户无需压缩需求,可像撰写设计文档一样完整描述画面结构、文案内容、视觉风格和版式细节,从而获得更加精准的生成结果,降低反复修改和人工调试成本。 在复杂内容理解方面,Qwen-Image-3.0进一步强化了语义解析和空间布局能力,能够一次生成覆盖多个主题的九宫格知识图解,兼顾文字清晰度与内容准确性。同时,模型支持复杂逻辑嵌套,可根据单条指令生成网页、软件界面、聊天窗口、海报等多层视觉元素组合。例如,在“VSCode编程界面中,通过千问App生成一张发布在聊天界面的手冲咖啡海报”等复杂场景下,模型能够准确理解多层UI关系,并保持各级界面风格一致,甚至对约10像素的小字号文字也能实现清晰呈现。 官方表示,Qwen-Image-3.0在人像摄影、数学试卷、古碑拓片、直播页面等场景均具备较强的细节还原能力,对复杂图文混排和高密度信息承载进行了重点优化。 随着生成式AI逐步进入专业设计和商业内容生产环节,图像模型的竞争正从基础画质转向复杂信息表达、可读性和工程化能力。Qwen-Image-3.0的发布,进一步推动AI图像生成向高精度、多语言和商业可用方向发展。

2026

aibase资讯

千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒

大模型厂商在语音赛道的军备赛,又多了一名重量级选手。 7 月 20 日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS,把说话这件事的控制权,从繁琐的参数配置交还到了一句自然语言指令手里。 这款新模型最鲜明的标签是Free-style自然语言指令控制。过去要让AI念出某种语气、节奏或风格,往往得在后台调一堆工程参数;如今用户只需用日常语言描述想要的效果,模型就能照着指令把声音合成出来,门槛被大幅削平。 更关键的是,千问为不同场景准备了两副面孔。面向实时交互的Flash版本,把首包延迟压到了 300 毫秒级别,这个量级意味着对话里的语音响应几乎感觉不到停顿,足够撑起实时问答、语音助手这类对延迟极度敏感的现场;面向高质量生成的Plus版本,则把火力集中在音质与表现力上,主攻有声书、配音、内容创作等需要细腻声音质感的任务。一条产品线,同时覆盖了快和好两条原本相互拉扯的需求曲线。 当自然语言成了控制语音的遥控器,千问这一步,把语音合成从工程活儿又往普通人的工具箱里推进了一格。

2026

aibase资讯

唐杰亲自剧透GLM-5.5:一句"史诗级plus",把国产大模型的军备赛又挑高了一截

国产大模型的密集爆发,正把和美国旗舰闭源AI的身位拉近到肉眼难辨。快科技7月20日报道,在千问、Kimi接连秀出肌肉之后,轮到智谱出手了,传闻中的GLM-5.5被描述为一轮史诗级提升。而这次不是媒体猜测,是智谱创始人唐杰亲自下了场。 有网友在评论里提到,千问和Kimi都完成了史诗级进化,顺口问了句GLM还有没有戏。唐杰的回应当场把期待值拉满——他用了一个词:史诗级plus。这意味着,在智谱自己的判断里,这一代的提升幅度比网友提到的那些还要大。 具体的数字现在当然无从谈起,但唐杰显然希望外界对GLM保持信心。他的底气来自上一代的战绩:在Kimi K3登场之前,GLM-5.2是国产大模型中 第一 个在AI编程能力上追平Opus级别性能的选手。更值得注意的是它的体量——GLM-5.2的参数规模只有7400多亿,差不多是Kimi K3的四分之一,大概也只有美国 顶级 AI的五分之一甚至更少,却硬是靠后训练把能力托到了那个水位,堪称小参数撬动大能力的样本。 唐杰口中的史诗级plus新模型,指向的应该是下一代GLM-5.5。此前圈内传过GLM-5.3的名字,但现在看GLM-5.5的可能性更大,当然也不排除发布时直接冠上GLM-6的名号。一个可以确定的趋势是,下一代大模型的参数量至少会迈过1万亿的门槛。考虑到智谱历史上曾使用过DeepSeek开源的基模,外界猜测GLM-5.5或许会做到与V4Pro 同级 的1.6万亿参数;再叠加智谱公认颇强的后训练功力,其性能跃升确实值得押注,很可能又是一个对标Fable5量级的国产大模型。 不过在国产阵营的等待名单里,眼下最让人坐立难安的,还是DeepSeek V4的正式版。报道发出时,7月中旬的最后一刻——当天零点——正悬在头顶,那条小鲸鱼究竟是打算半夜甩出大招,还是又一次跳了票,谁也说不准。当智谱用一句史诗级plus把话题点燃,国产大模型这场接力赛,显然还远没到撞线的时候。

2026

数字生命卡兹克资讯

AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜。

原创 数字生命卡兹克 2026-07-21 09:11 北京 一个Token验真伪 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 Llama 3.3,则多数是53。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。 所以说,为啥 布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证, 看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。 只需要模型输出一个 Token,就够锁定你是谁。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 而且这事之所以这么普遍,纯粹是经济结构决定的。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 但问题在于, CISPA 这套 LLMmap的 方法依然很重。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的 LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个

2026

huggingface-papers论文

RynnBrain 1.1:迈向更强能力和通用性的具身基础模型

We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.

2026

Simon Willison's Weblog资讯

Who’s Afraid of Chinese Models?

Who’s Afraid of Chinese Models? Interesting proposal from Ben Thompson that both addresses the hypocrisy of labs outlawing distillation against their models despite training on unlicensed data, and could help US open models compete more effectively with their Chinese counterparts: The U.S. should pass a law that (1) makes explicit that collecting data for training models is fair use, and (2) bars terms of service that forbid distillation, for U.S. companies at a minimum. Stopping distillation — which is literally just querying the API — is nearly impossible; the U.S. should go the other way and lean into a new copyright policy that both indemnifies the labs and also guarantees that what they learned fuels further innovation for everyone else. Ben also theorizes that Alibaba's decision to release Qwen 3.8 Max as open weights - a reversal from their decision not to release Qwen 3.7 Max in May - may have been influenced by a recent speech by Xi Jinping, who said: We should seize this rare, historic opportunity to encourage open source, openness, collaboration and sharing. Via John Gruber Tags: ai, generative-ai, llms, training-data, qwen, ai-ethics, ai-in-china

2026

aibase资讯

首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

近日,阿里通义千问团队正式发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,推动语音合成从“能说话”迈向“会表达”。其Plus版本已在全球 权威 榜单Artificial Analysis的Speech Arena中斩获全球 第一,综合表现超越Gemini3.1TTS、ElevenLabs v3等主流模型。 本次发布包含双版本:Flash版主打实时交互,首包延迟约300ms,适配智能助手等低延时场景;Plus版聚焦高质量生成,自然度与音色还原度更优。 核心能力实现四大突破: 一是多语种与方言覆盖升级,支持16种语言,Plus版在全部16种语言上的平均说话人相似度达82.75,位列行业 第一;同时支持20种中文方言,避免“方言特色弱化”问题,更贴近母语者表达。 二是支持Free-style自然语言指令,无需专业标注,用“温柔客服语气”“带货主播风格”等自然语言即可精准生成对应语音。 三是细粒度标签控制,支持[gasp]、[angry]等结构化标签,可精确调控呼吸、笑声等非语言细节,适配游戏、有声书等场景。 四是复杂声学鲁棒性强,即便参考音频存在高噪声、高混响,也能自动过滤杂音、保留音色,合成质量稳定。 配套精品音色库覆盖指令、方言、小语种等多类音色,支持48K高清音频输出(预计7月24日开放),单次合成最长支持3分钟长文本。目前模型已在阿里云百炼平台全面开放,开发者可接入体验,共同探索语音交互新可能。

2026

aibase资讯

阿里发布Token Plan个人版,Qwen3.8-Max-Preview同步上线

7月19日,阿里正式发布Token Plan个人版,并同步开放Qwen3.8-Max-Preview体验。该模型参数规模达到2.4万亿,在代码工程、专业办公等场景中展现出较强能力,正式版本预计将于近期发布并开源。 据了解,Qwen3.8-Max-Preview目前可通过Token Plan抢先体验。为降低用户使用门槛,阿里推出限时优惠方案,其中个人版Lite套餐售价39元/月,Standard套餐139元/月,Pro套餐499元/月;团队版则提供标准、 高级 和尊享三类席位,价格分别为150元、550元和1398元/席位/月。 针对Qwen3.8-Max-Preview,阿里同步推出限时体验活动,白天Credits消耗降至1折,个人版Token Plan用户夜间使用还可在此基础上享受进一步折扣。 除Token Plan外,阿里旗下AI编程产品Qoder和QoderWork也已首发支持Qwen3.8-Max-Preview,千问PC端用户可免费体验该模型能力。 随着大模型竞争从单纯性能比拼转向模型能力、成本控制和生态建设的综合竞争,阿里通过Token Plan、开发工具及开源策略进一步扩大Qwen系列模型应用范围,加速大模型在开发、办公等生产力场景中的落地。

2026

aibase资讯

阿里新一代大模型千问3. 8 将至:预览版抢先登陆阿里云与Qoder,正式版拟近期开源

大模型的开源节奏,正在被国内头部厂商越拉越紧。 据悉,阿里 最新 一代大模型千问3. 8 即将发布并同步开源,这意味着通义千问家族在开源赛道上又向前迈出一步。 新模型的体验窗口已经悄然打开。目前,Qwen3.8-Max预览版已率先上线阿里云Token Plan、Qoder以及QoderWork三个平台,用户现在就能提前摸一摸这一代新模型的能力边界。按照阿里的规划,Qwen3.8-Max的正式版将于近期正式推出并开源,届时完整的模型权重将向开发者开放。 在国产大模型密集发力的当下,阿里选择让预览版先行、正式版紧随开源,既提前释放了产品信号,也把模型能力放进真实用户场景里接受检验。千问3. 8 正式版开源的那一刻,开源大模型阵营的 天花板,大概率又要被重新丈量一次。

2026

数字生命卡兹克资讯

不会代码也能做产品,这是一份从0开始的Vibe Coding保姆级教程。

原创 数字生命卡兹克 2026-07-20 08:08 北京 Agent就是我们最好的老师 最近,国产大模型也都起飞了。 基本都达到了半步Fable 5境界。 2.8T的Kimi K3,2.4T的Qwen 3.8 Max,而在未来,肉眼可见的,还有马上上线的DeepSeek V4正式版,还有Seed、GLM、MiMo、LongCat等等要到来的更大规模的版本。 我觉得,这就是所有在国内,想用AI搓一个自己的产品、所有想把自己想法变成现实的人,最好的黄金岁月。 现在,你不需要捏着鼻子用海外的模型了,考虑到对面封号、考虑到魔法、考虑付费等等,你可以直起身来,用我们自己的模型,来做你自己想做的东西。 包括我自己搓的产品AIHOT,从5月发布开始,到今天,2个多月的时间,最近一周的周活终于过了30万,月活也正式过了60万。 所以,我觉得今天,我也可以分享一下,作为一个纯外行,如果你想从0开始,用国产模型,徒手搓出一个完全属于自己的产品,应该需要哪些步骤和流程,还有一些乱七八糟的坑。 先叠甲一下,下面这套流程,是我自己作为非专业者,目前跑得比较舒服的一条路径,主要面向完全不懂代码、想先把第一个产品做出来的人。不同类型的产品,可以选择不同的托管平台,工程团队也会有不同的开发规范。 这里讲的是一条足够简单、能够从零走到正式上线的方案,完全不代表唯一的标准答案。 那,让我们开始吧。 1. 买一个国产大模型的Coding Plan套餐。 你需要一个能帮你写代码的AI。 Kimi、GLM、Qwen等等都无所谓,能买到哪个就用哪个,差距没有你想象的大。 2. 去下载各家官方的Agent编程产品。 买了Coding Plan之后,去下载各家官方的Agent编程产品。 ZCode、Qoder、Kimi Code等等,你买了哪家的Coding Plan就用哪家的,因为未来肯定是自家的Agent更适合自家的大模型,可以提前用了。虽然现在很多的Harness还是不如Claude Code,但是我觉得会很快的补上。 3. 想好你的产品名字。 很多人觉得名字随便起一个就行了,做完再改。 但不是这样的,你后面所有的东西,logo、域名、备案、小程序名称、App Store上架,全都跟名字绑定,改名的成本比你想象的大一百倍。 名字简短、好记、最好有一点辨识度,起名的时候顺便在微信搜一下公众号、小程序有没有同名的,在App Store和各大应用商店搜一下有没有撞车的。 这一步花十分钟,能省你后面很多麻烦。 4. 注册一个域名。 名字想好的那一刻,立刻去注册域名。 去火山引擎、腾讯云、阿里云啥的都可以,去域名注册页面,搜你想要的域名。 我自己就是在这一步吃了亏,AIHOT当时真的就是随便取的,然后后面没想到这玩意做起来了,结果一查,AIHOT.com这个域名,是我可能永远都买不起的程度。。。 5. 买一台服务器。 你的产品做出来之后,它得有一个地方运行,不能跑在你自己电脑上,你电脑一关,全世界都访问不了了。 为了让整套教程拥有一条统一、直观的路径,所以我们下面都以以云服务器为例,部分静态网站和轻量产品也可以使用Serverless、云开发或托管平台啥的,不一定需要自己维护服务器。 不过现在维护服务器因为有了Agent之后,维护已经很简单了。 买服务器这里,推荐一下腾讯云上的服务器,新客一般都有大优惠,一年一个轻量的可能才99或者199,轻度产品使用足够了,不知道配置怎么选,就直接截图问你的AI,告诉它你想做什么产品,让它帮你挑。 当然,最好的方式,就是让Agent操控你的浏览器,直接帮你选。 6. 同步去做ICP备案。 这一步非常重要。 在中国大陆,你的域名如果要对外提供服务,必须做ICP备案。不备案,域名解析直接被运营商拦截,用户打不开你的网站。 在你买服务器的那个云平台上找到“备案”入口,按指引提交身份证、域名信息、网站名称,然后等审核,一般一到两周。 一定要跟开发同步进行,别等产品做完了才想起来备案。 如果你做的是出海产品,那就无所谓了,但出海的话记得买海外服务器,比如新加坡或者美西的节点,离你的目标用户近一些。 7. 新建一个你的项目文件夹。 OK,准备工作全部做完了。域名有了,服务器有了,备案提交了,AI编程工具也装好了。 现在,在你的电脑上新建一个文件夹。 就这样。起一个跟你产品名字一样的文件夹名,放在你喜欢的位置。 这个文件夹,就是你接下来整个产品的家,你的所有代码、所有配置、所有文档,都会在这个文件夹里。 8. 在这个项目文件夹下,启动你的Agent,开始开发。 打开你第2步装好的Agent编程产品,把工作目录指向你刚才建的那个文件夹。 具体怎么操作,每个产品不太一样,但大致都是"选择一个工作目录"然后开始对话。 从这一刻开始,你的AI就驻扎在你的项目里了,它能看到你的文件,能帮你创建新文件,能帮你写代码、跑代码、调代码。 9. 注册一个GitHub账号。 GitHub是全球最大的代码托管平台。 你的代码不能只存在你自己电脑上,万一硬盘坏了、电脑丢了,你什么都没了。 所以,可以注册一个GitHub账号(免费的),让Agent帮你连接上你的GitHub账号,然后把你的代码推到GitHub上的一个私有仓库里,注意是私有仓库,不是公开的。 整体告诉你的Agent一句话就行了。 “初始化Git仓库,连接我的GitHub账号,创建一个私有GitHub仓库,并提交第一个初始版本。” 现在,你和Agent你们两两个的协作,正式开始。 10. 开启Plan模式,说清楚你要做什么。 大多数Agent编程产品都有一个Plan模式(或者叫规划模式),用人话告诉AI你想做什么,它会先帮你理清楚需要做哪些事情,列出一个计划清单,别直接开始执行。 你在这一步要做的事情就是,用最简单直白的语言,描述你的产品。 注意,不要想太多,你不需要画原型图,不需要写需求文档,不需要列所有功能,就说你最核心想要的那个东西,后面的功能可以慢慢加,但第一版可以比较简单。 先看到那个产品出来的正反馈,比什么都要强。 AI会根据你的描述生成一份规划文档,你看一下是不是你想要的方向,确认了就进入下一步。 11. 让Agent根据Plan文档,开始执行开发。 确认了Plan之后,告诉Agent开始执行。 它会自动创建项目结构、写代码、装依赖等等,你什么都不用管,看着它干活就行,过程中,它做完一块会问你要不要看看效果,或者有没

2026

twitter-ginobefun资讯

BestBlogs 早报 · 07-20 # Vidu S1 / Agent 云 / Netfl

BestBlogs 早报 · 07-20 # Vidu S1 / Agent 云 / Netflix / Qwen3.8 / 政府 AI 治理 [1] ★ 精讲|Netflix CPTO Elizabeth Stone 谈 AI 与产品、技术角色的未来 [视频] Netflix 技术负责人 Elizabeth Stone 的判断很克制:AI 加快原型和生产流程,却没有替代品味、责任与创作者选择。她把真正的准备工作落到可信数据、访问控制、安全护栏和人才密度,给管理者一套比追逐模型更新更耐用的组织检查表。 来源:Lenny's Podcast [2] ★ 精讲|Vidu S1 如何让视频生成跨过实时门槛 [播客] Vidu S1 把视频扩散推理压到约 4 步,并从算子、模型到集群服务逐层优化,在消费级 GPU 上实现 540P、25–42 FPS 的持续生成。文章的价值不只在速度数字,更在于拆清实时视频从模型能力走向可部署系统时,计算、显存与调度瓶颈如何转移。 来源:十字路口 Crossing [3] ★ 精讲|对话 PPIO 姚欣:Token 工厂的第一客户不再是人,而是 Agent PPIO 把 Agent 云拆成模型网关、上下文工程、沙箱与 Harness 四层:前者处理多模型路由、缓存和故障切换,后者为代码执行提供隔离环境。文中的降本增效数据来自公司披露,仍需外部验证;更值得关注的是,云基础设施正围绕 Agent 的长任务形态重构。 来源:智东西 [4] Qwen3.8 发布:拥有 2.4T 参数(官方) Qwen 宣布推出 Qwen3.8,这是一款拥有 2.4T 参数的模型,性能媲美前沿模型,目前预览版已开放。 来源:Qwen(@Alibaba_Qwen) [5] SK 海力士崛起史:一个荒诞又狗血的财阀故事,如何卡住全球 AI 的脖子 本文梳理了 SK 海力士从纺织起家到垄断 HBM 内存、助力 AI 算力的崛起历程,并分析其财阀背景、技术押注及市场影响。 来源:硅谷 101 [6] Netflix 如何构建 GenPage:一个用于构建个性化主页的单一 GenAI 模型 Netflix 的 GenPage 用单一的生成模型取代了多阶段推荐流水线,直接利用用户上下文作为提示词来创建个性化主页,实现了更高的用户参与度,并将端到端服务延迟降低了 20%。 来源:InfoQ [7] 用 Claude 重写 SQL 解析器,性能暴涨 70 倍:程序员做的不是写代码,而是搭建验证闭环 本文详述了作者如何利用多个并行 Claude Code 会话,通过测试驱动开发与基于属性的测试,将 PostHog 的 SQL 解析器用 Rust 重写,最终在生产环境中实现 454 倍性能提升的完整过程。 来源:AI 前线 [8] Demo 跑通了,上线就翻车?Java Agent 生产的那些坑,我们帮你填了 Java Agent 在生产环境落地的关键难点在于运行时的稳定性、记忆管理、工具溢出保护与可观测性,本文通过 Spring‑Ai‑Trip 框架系统性填补这些空白。 来源:携程技术 [9] 自主科学任务智能体如何突破研究瓶颈 [视频] Sina Shahandeh 解释了自主编码智能体为何会在开放式科学任务中陷入停滞,并提出以显式层级脚手架、多模态审查与推理模型批评来形成更强假设、维持实验循环。 来源:AI Engineer [10] 一个关于政府 AI 合同的红线与监督框架 — LessWrong 一位前谷歌 DeepMind 工程师提出了一个详细的治理框架,包含两条红线(人类对瞄准目标的控制;禁止无目标的 AI 画像分析)和一个审查机构,以在政府 AI 合同中强制执行透明度。 来源:LessWrong --- · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读: ginobefun:

2026

huggingface-papers论文

RynnBrain 1.1:迈向更强大且具泛化能力的具身基础模型

We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.

2026

twitter-elvis资讯

Excited for the Qwen 3.8 open-weight release. I have had real success

Excited for the Qwen 3.8 open-weight release. I have had real success with Qwen 3.7 for subagent workflows in harnesses like Hermes Agent. They are doing something right around agentic capabilities. If Qwen 3.8 is a significant improvement, you don't want to ignore it. Qwen: Qwen3.8 is launching and going open-weight soon!🌐 With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models, second only to Fable 5. You don't have to wait to

2026

twitter-meng shao资讯

DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qw

RT meng shao DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂

2026

twitter-meng shao资讯

DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent ...

DeepSeek V4 和 GLM 5.2 的发布本就非常刺激了 这周 Kimi K3 和 Qwen 3.8 接连曝光,直逼 Claude Fable 5 和 GPT-5.6 Sol 而去! 加上这一代提升很大的 Tencent Hy3,虽然有些落后但下一代还很值得期待的 MiniMax M3,AI 模型 SOTA 几乎每周都有易主的可能,至少开源 AI 模型是! Gemini 3.5 Pro 还会有奇迹吗?本来剧透是 07.17 发布的,结果团队内部评估没过关 😂

2026

twitter-meng shao资讯

中国开源模型狂奔中! Qwen 3.8 也要发布了,2.4T 参数,仅次于 Claude Fable 5! 哇哦!

中国开源模型狂奔中! Qwen 3.8 也要发布了,2.4T 参数,仅次于 Claude Fable 5! 哇哦! Qwen: Qwen3.8 is launching and going open-weight soon!🌐 With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models, second only to Fable 5. You don't have to wait to

2026

twitter-Gorden Sun资讯

Qwen 3.8 Max发布了,2.4T参数,后续会开源,也是宣称仅次于Fable 5。 历史上每一代Qwen Max都很拉,我不测了,你们测吧。。。

Qwen 3.8 Max发布了,2.4T参数,后续会开源,也是宣称仅次于Fable 5。 历史上每一代Qwen Max都很拉,我不测了,你们测吧。。。 Qwen: Qwen3.8 is launching and going open-weight soon!🌐 With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models, second only to Fable 5. You don't have to wait to

2026

newest submissions : MachineLearning资讯

尝试在 s26 ultra 上测试 qwen 35b moe 模型,不牺牲精度 [R],[D]

Started testing a private qwen 35B moe capacity LLM runtime on s26 ultra, early testing shows that active model footprint can fit within the device’s memory limits.( not sharing the methods or architecture used) and results suggest roughly 90 input processing t/s achievable after optimisation and output generation is around 8 tokens/s on this mobile. Point is i learned ai ml based on my interest and no formal PhD, I have compute and resources to test. Anyone willing to join or collab to test on this I tried publishing papers on arxiv and 4 papers are still on hold as im first author and from no institution... submitted by /u/Severe_Post_2751 [link] [comments]

2026

huggingface-papers论文

LongStraw:固定GPU预算下超越200万Token的长上下文强化学习

A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.