2026-07-21 00:02:15
Kimi K3发布后,美国华盛顿的反应正在从“惊叹中国模型追赶速度”,转向“是否需要限制美国企业使用中国模型”。
Axios 7月20日报道称,特朗普政府内部出现了重新推动限制中国前沿AI模型的迹象。报道所描述的政策选项包括把中国AI实验室列入美国商务部实体清单、通过政府采购规则制造事实上的禁用效果、发布国家安全警示,以及要求美国企业在托管中国模型时承担更严格的安全责任。
但需要首先澄清:美国尚未针对Kimi K3颁布新的制裁令,也没有正式宣布全面禁止中国开源或开放权重模型。Axios的消息来自熟悉政府内部讨论的匿名人士,白宫和美国商务部均未回应其置评请求。
因此,真正值得讨论的问题不是“美国已经制裁Kimi”,而是Kimi K3的突然崛起,是否成为特朗普政府内部限制中国AI模型声音再次升高的催化剂。
月之暗面公布的Kimi K3拥有2.8万亿总参数、100万Token上下文和原生视觉能力,采用大规模混合专家架构。官方把它称为首个开放的“3T级”模型,并计划在7月27日前发布完整权重。
Kimi K3最具冲击力的地方,并不只是参数规模。Arena的早期盲测显示,它在前端编程偏好测试中超过Claude Fable 5和GPT-5.6 Sol;在更广泛的文本排名中也进入前沿区间。月之暗面自己的技术报告则承认,Kimi K3的综合体验仍落后于Fable 5和GPT-5.6 Sol,但在部分编码、GPU内核优化和长时间智能体任务中表现出强大竞争力。
对于美国AI产业,这意味着一个长期假设正在动摇:最强模型可以由少数美国公司封闭运营,再通过高价API向全球出售。Kimi K3不仅接近美国旗舰模型的部分能力,还准备开放权重,让企业能够下载、定制并部署在自己的基础设施上。
美国企业采用中国模型的动力也很现实。开放权重提供更大的数据控制和部署自由,一些中国模型的调用价格又低于美国顶级闭源模型。当质量差距缩小到特定任务中难以察觉时,采购部门会自然比较成本,而不会只根据模型的国籍作出选择。
Axios称,美国商务部在此前一年就曾考虑把多个中国AI实验室加入实体清单。如果实施,美国企业在没有许可证的情况下与相关机构开展某些交易或提供受管制技术将面临限制。
报道还提到,美国国家安全局和白宫国家网络总监办公室曾考虑针对中国AI实验室发布安全警示;白宫内部也讨论过要求美国托管商为中国模型的安全风险提供保证,并在出现安全事件时承担责任。美国商务部还曾流转利用供应链安全权限限制中国开放模型的规则草案。
这些方案此前没有落地,原因之一是政府内部存在明显分歧。支持自由创新的官员担心,广泛限制模型会压制竞争、提高美国企业成本,并让OpenAI和Anthropic进一步巩固双头垄断。国家安全鹰派则担心中国模型可能存在数据治理、供应链、后门和网络安全风险。
如果新一轮限制真的出现,它未必会采用一句话宣布“禁止Kimi”的形式。更可能的路径包括:
这种做法不需要在技术上完全阻止模型下载,也能显著提高美国企业使用中国模型的法律与合规成本。
从时间和Axios信源的表述看,Kimi K3确实重新点燃了特朗普政府内部原本已经存在的限制讨论。报道直接称,Kimi在上周的崛起让此前的封禁努力再次升温。
但将其描述为特朗普本人因为Kimi K3而立即下令制裁,缺乏证据。现有信息显示,这场争论早于Kimi K3发布,围绕的是中国开放模型、网络安全、美国AI竞争力以及本土企业利益之间的长期冲突。Kimi K3更像是一记突然加速政策讨论的警报,而不是凭空创造政策的唯一原因。
特朗普政府内部的态度也并不统一。曾担任白宫AI主管、目前担任总统科技顾问委员会联席主席的David Sacks,在Kimi K3发布后提出了几乎相反的结论。他认为Kimi的进步说明美国不能用繁琐审批束缚本国模型,而应该依靠基础设施、能源、出口和无许可创新保持领先。
换言之,同一个Kimi K3,在不同政策派别眼中代表两种相反信号:
这也解释了为什么Axios将其描述为特朗普政府内部的“秘密战斗”,而不是已经统一形成的政策决定。
如果美国对中国模型实施广泛限制,最直接的受益者很可能是OpenAI和Anthropic。美国企业失去低价开放权重选项后,将更依赖两家公司的闭源模型和API服务。
这正是支持竞争人士担忧的地方。以国家安全为理由建立的高门槛,可能同时成为保护本土头部企业的竞争壁垒。尤其是在美国前沿模型收入已经高度集中于少数公司的情况下,限制中国开放模型可能进一步减少价格压力和技术路线竞争。
当然,安全疑虑不能因为市场竞争而被完全忽略。企业部署外部模型时确实需要评估训练数据来源、更新机制、远程代码、依赖包、模型供应链和敏感信息处理方式。开放权重也不等于没有风险,只是风险形态与调用封闭API不同。
真正合理的政策应当针对可验证风险,例如政府敏感系统、关键基础设施、数据外传和供应链漏洞,而不是仅凭开发者来自中国就对所有模型进行一刀切处理。否则,美国可能在阻止中国模型进入本国市场的同时,失去研究、审计和改进开放模型的机会。
Kimi K3计划公开完整权重,这使传统制裁工具面临一个现实问题:模型文件可以被下载、复制、镜像和离线部署。美国可以限制公司交易、云端服务、政府采购和商业分发,却很难让已经在全球传播的权重彻底消失。
因此,潜在禁令更可能影响正规企业和云服务商,而不是完全阻止技术流通。大型美国公司为了避免合规风险,可能停止提供Kimi托管服务;但研究人员、海外公司和具备本地算力的机构仍可能继续使用。
这会带来一个反直觉结果:美国市场可能更加依赖少数封闭模型,而中国开放权重生态继续在其他国家扩散。限制措施能否真正削弱中国AI影响力,还是只会把创新和部署转移到美国监管范围之外,将成为政策制定者必须回答的问题。
截至目前,可以确认的是:Kimi K3的能力和开放权重计划在硅谷与华盛顿引发了明显震动;特朗普政府内部限制中国前沿AI模型的讨论正在重新升温;实体清单、采购规则、安全警示和托管责任都可能成为政策工具。
不能确认的是:特朗普已经签署针对Kimi K3的新命令、美国已经全面禁止中国AI模型,或者商务部已经把月之暗面列入实体清单。
接下来应重点观察白宫、美国商务部工业与安全局、联邦采购部门和国家网络安全机构是否发布正式文件。只有出现行政命令、联邦公报规则、实体清单更新或政府采购指令,所谓“最新制裁令”才从政治讨论变成可以执行的政策。
Kimi K3或许没有直接触发一纸禁令,但它已经迫使美国重新面对一个更难的问题:当中国的开放模型在部分任务上追平甚至超过美国闭源旗舰时,美国应该用更强的竞争回应,还是用监管壁垒把竞争者挡在门外?
资料来源:
本文依据截至2026年7月20日的公开信息撰写。Axios关于政府内部讨论的内容主要来自匿名信源,白宫和美国商务部尚未公开确认相关计划。本文不将尚未公布的政策描述为已经生效的制裁措施。
2026-07-19 21:12:41
中国大模型的参数竞赛,正在以令人惊叹的速度冲向一个此前难以想象的规模。
7月19日,阿里巴巴Qwen官方账号宣布,Qwen3.8即将推出并开放模型权重。官方给出的总参数规模达到2.4万亿,并称这款模型仍在持续演进,其能力可与全球领先的前沿模型竞争,在Qwen自己的判断中“仅次于Claude Fable 5”。
这不是一次普通的版本更新。就在几天前,月之暗面发布了拥有2.8万亿总参数的Kimi K3;OpenAI则在7月全面推出GPT-5.6系列,旗舰型号Sol主打复杂专业工作和智能体任务;Anthropic的Claude Fable 5继续占据多个高难度评测的领先位置。Qwen3.8的出现,意味着最强模型的竞争不再只是OpenAI与Anthropic两家美国公司的内部赛跑,而是演变为封闭旗舰与中国开放权重模型之间的正面碰撞。
Qwen官方帖文透露的信息很短,却包含两个极具冲击力的关键词:2.4万亿参数和Open Weight。
从总参数规模看,Qwen3.8已经远远越过传统百亿、千亿参数模型的范围,进入万亿级混合专家模型的新阶段。作为对照,Kimi K3拥有2.8万亿总参数、100万Token上下文和原生视觉能力。Qwen尚未披露Qwen3.8每次推理会激活多少参数、上下文长度、多模态范围、训练计算量和部署要求,因此仅凭2.4万亿总参数不能直接判断它的速度、成本与真实能力。
但“开放权重”让这次预告的意义明显放大。如果后续发布允许开发者下载、部署和研究模型,Qwen3.8就不只是一个通过网页或API访问的云端产品,而会成为全球开发者、企业和研究机构可以实际掌握的前沿基础设施。
参数规模并不等于智能水平,开放权重也不必然意味着容易部署。一个2.4万亿参数模型对硬件、显存、并行推理和运维能力的要求极高,即使采用MoE架构和量化技术,本地运行完整版仍可能只属于大型机构。不过,权重开放会促进量化、蒸馏、推理框架优化和行业微调,其外溢影响远大于一个完全封闭的API模型。
Qwen官方最引人注意的表述,是称Qwen3.8可与领先前沿模型竞争,并“仅次于Fable 5”。这相当于主动把Claude Fable 5设为最高参照物。
Anthropic在6月发布Fable 5时,将其定位为面向最复杂、最长周期任务的Mythos级模型。官方称它在软件工程、知识工作、视觉和科学研究等多个领域达到自身最强水平,并且任务越复杂、执行时间越长,相对旧模型的优势越明显。
Qwen目前没有随预告公布完整基准成绩,也没有说明“仅次于Fable 5”依据哪些评测、推理配置和成本条件。因此,这一排名现阶段应被理解为Qwen的产品定位,而不是经过独立验证的统一结论。
真正令人惊叹的地方,恰恰不是Qwen是否已经在某张榜单上追平Fable 5,而是一款即将开放权重的中国模型,已经公开把Anthropic最高能力档作为直接竞争目标。
GPT-5.6 Sol代表了另一条路线。OpenAI把它定位为GPT-5.6家族的旗舰,重点提升编程、专业知识工作、网络安全、科学任务和长时间智能体执行。它支持约105万Token上下文,并提供更深的max推理以及由多个子智能体协作的ultra模式。
OpenAI强调的重点并不是参数规模,而是单位Token效率、任务完成率、速度和总成本。在OpenAI公布的评测中,GPT-5.6 Sol在多项编程与智能体任务上超过Fable 5,同时在另一些综合智能评测中仍略低于Fable 5。这说明“谁是最强模型”已经无法用一张排行榜简单回答:模型可能在代码、专业工作、视觉设计、科学推理、速度和成本上分别领先。
Qwen3.8与GPT-5.6 Sol的竞争因此很有代表性。前者用2.4万亿参数和开放权重制造震撼,后者用高度产品化的工具链、推理档位和智能体系统强调完成真实工作的效率。一个让开发者拥有模型,一个让用户直接获得成熟服务,两者争夺的是不同层面的控制权。
如果说GPT-5.6 Sol和Fable 5是Qwen3.8的国际参照,那么Kimi K3就是最直接的中国竞争者。
月之暗面公布的Kimi K3拥有2.8万亿总参数、100万Token上下文和原生多模态能力,采用混合专家架构,每个Token只激活部分专家。官方承认其综合表现仍落后于Fable 5和GPT-5.6 Sol,但称它在一系列评测中达到前沿水平。Kimi K3还在网页前端开发等部分公开竞技场中表现突出,完整权重计划于7月27日前发布。
Qwen3.8的总参数比Kimi K3少4000亿,但总参数并不能直接决定实际表现。关键要看激活参数、训练数据、推理架构、强化学习、视觉能力、工具使用和任务完成效率。Qwen此前已经建立了庞大的开源模型、云端API和Qwen Code生态,如果Qwen3.8能够以开放权重接近Fable 5,同时保持较好的推理成本和工具能力,其实际影响可能不亚于参数更大的Kimi K3。
更值得关注的是节奏:Kimi K3刚刚用2.8万亿参数震动行业,Qwen随即预告2.4万亿参数的Qwen3.8。中国模型厂商已不再满足于追赶上一代美国旗舰,而是开始围绕当代最强模型展开高频竞速。
几年前,开放模型通常意味着能力落后、上下文较短,或者只能承担相对简单的任务。如今,Kimi K3和Qwen3.8开始把开放权重模型推进到万亿参数和前沿能力区间,并直接与Claude Fable 5、GPT-5.6 Sol比较。
这可能改变整个AI产业的议价结构。封闭模型的优势在于稳定服务、安全体系、产品体验和完整工具生态;开放权重模型则给予企业更多部署控制、数据自主权和二次开发空间。当开放模型的能力差距从一代缩短到几个百分点,企业是否必须依赖少数美国API供应商,就会成为一个可以重新计算的问题。
当然,现在还不到宣布Qwen3.8胜负的时候。官方尚未披露正式发布日期、许可证、激活参数、上下文、多模态能力、API价格和完整评测。开放权重承诺也需要等待文件真正发布后才能验证。
但仅从这次预告已经可以看到一条清晰趋势:Fable 5仍然是许多团队试图挑战的能力标杆,GPT-5.6 Sol正在把智能体效率推向更高水平,Kimi K3用2.8万亿参数打开了超大规模开放模型的想象空间,而Qwen3.8准备以2.4万亿参数加入同一战场。
最令人惊叹的,不是哪一家在今天暂时领先,而是前沿模型的封闭与开放、中国与美国、规模与效率之间,已经从遥远追赶变成了几乎同时发生的正面竞争。
资料来源:
截至发稿时,Qwen3.8仍处于预告阶段。本文对其能力与影响的讨论基于Qwen官方表述和已公开信息,最终规格、许可证及独立评测结果以正式发布为准。
2026-07-18 21:50:02
孙正义正在把软银推向又一次足以改变公司命运的豪赌。押注对象是OpenAI,筹码则不仅包括现金,还包括软银的融资能力、资产负债表,以及资本市场对人工智能长期价值的信心。
乐观者会想到软银早年投资阿里巴巴的传奇回报;怀疑者则会想到WeWork——一个在私募市场拥有耀眼估值,却在接受公开市场检验前迅速失速的故事。OpenAI当然不是WeWork,但软银当前的风险结构,已经让这个对比不再只是情绪化的讽刺。
根据软银集团公告,公司在2026年2月同意向OpenAI追加投资300亿美元。完成全部追加投资后,软银对OpenAI的累计投资预计在2026年10月达到646亿美元,持股比例约为13%。这意味着OpenAI已经从软银投资组合中的重要资产,变成足以左右集团估值的核心变量。
OpenAI在2026年3月完成的新一轮融资共有1220亿美元承诺资本,投后估值达到8520亿美元。如此庞大的私募估值,为软银带来了可观的账面收益,也抬高了下一次融资或上市时必须跨越的门槛。
公开市场近期已经给出了敏感反应。OpenAI考虑把IPO推迟至2027年的报道出现后,软银股价在6月26日单日下跌超过12%。从近期约9074日元的52周高点,到7月中旬约6000至6500日元的交易区间,回撤幅度接近三成。把全部跌幅都归因于OpenAI并不严谨,但软银正在成为投资者表达OpenAI看多或看空观点的少数公开市场工具之一。
软银面临的关键问题并非OpenAI最终值多少钱,而是这项非上市股权何时能够转化为可用的现金。
2026年3月,软银签署了总额400亿美元的过桥贷款协议,主要用于支持对OpenAI的追加投资。该贷款将在2027年3月25日到期。过桥贷款本来就是等待长期融资或资本市场交易完成前的临时工具;如果OpenAI在贷款到期前上市,软银可以获得更清晰的市场定价,也可能通过出售少量股份、再融资或其他结构缓解资金压力。
问题在于,OpenAI的IPO时间表并不由软银控制。《纽约时报》等媒体援引匿名知情人士称,OpenAI倾向于把上市推迟到2027年,Sam Altman希望寻求约1万亿美元的上市估值。这不是OpenAI已经公布的决定,但若上市晚于过桥贷款到期日,软银就需要先解决债务,再等待OpenAI提供流动性。
这构成了典型的期限错配:用较短期限的负债,支持规模庞大且暂时缺乏公开交易市场的长期资产。OpenAI即使继续增长,也无法自动消除贷款到期时的现金需求。
软银正在尝试把OpenAI的账面价值转化为融资能力。彭博此前报道称,软银曾寻求以OpenAI持股作为抵押获得100亿美元保证金贷款,但由于贷款机构态度谨慎,一度把目标下调至60亿美元。路透社随后报道,软银重新就100亿美元贷款展开谈判,并提出母公司担保等额外条件。
这组谈判传递的信号比最终贷款金额更重要:私募市场的融资估值,并不等于银行在压力情景下愿意接受的抵押品价值。OpenAI股份缺少实时公开报价,转让也可能受到限制;一旦发生违约,银行处置大额非上市股权的难度远高于出售上市股票。因此,贷款机构自然会要求更低的抵押率、更强的担保和更严格的条款。
这并不意味着银行认为OpenAI没有价值,而是说明8520亿美元的投后估值不能像现金或公开交易的证券一样直接使用。软银持有的OpenAI股份越多,这种“账面价值很高、短期变现能力有限”的矛盾就越突出。
软银并非没有融资工具。集团拥有大量Arm股份,也可以利用债券、银行贷款、资产抵押和联合投资等方式筹集资金。OpenAI自身业务若持续高速增长,软银还可能在未来获得更高估值和更灵活的再融资条件。
但这些安全垫都有成本。继续发行债券可能推高利息支出;以Arm股份融资会进一步占用优质抵押品;直接出售Arm股份则可能产生税务成本,并给Arm股价和软银净资产价值带来压力。Arm既是孙正义构建AI生态的关键资产,也是软银资产负债表最重要的支柱之一,不能被视为无限提款机。
因此,“OpenAI不上市,软银就会立即出现危机”的说法过于简单。更准确的判断是:上市延迟会削弱软银的融资选择权,并迫使集团以更高成本管理债务期限。压力有多大,取决于OpenAI经营表现、贷款展期条件、资本市场利率以及Arm股价等多个变量。
把Sam Altman简单等同于马云或Adam Neumann,更多是一种资本市场修辞。OpenAI拥有全球化产品、快速增长的收入以及深厚的产业合作网络,其业务基础与WeWork存在明显差异;但估值越高、融资规模越大,公开市场对增长、利润和现金流的要求也越苛刻。
孙正义真正押注的,不只是OpenAI能够成为一家成功的AI公司,而是它能在软银债务期限变得紧迫之前,成长为足以支撑万亿美元估值、获得公开市场认可并提供流动性的公司。
这就是这场豪赌最危险的地方:方向正确并不足够,时间也必须正确。阿里巴巴式胜利需要长期持有和惊人增长;WeWork式教训则提醒投资者,私募估值、融资能力和公开市场接受度从来不是同一件事。
对软银投资者而言,接下来最值得观察的不是某一天的股价涨跌,而是四项指标:OpenAI实际IPO进度、软银400亿美元过桥贷款的再融资安排、OpenAI股权质押贷款的最终规模与条款,以及软银是否进一步动用Arm股份筹集资金。它们将决定孙正义这次下注,究竟是又一次改变时代的胜利,还是一场昂贵的流动性考验。
资料来源:
本文为基于公开信息的新闻分析,不构成任何投资建议。有关IPO时间、估值目标及贷款谈判的部分信息来自媒体匿名信源,最终安排可能发生变化。
2026-07-18 10:56:04
Claude官方宣布,从7月20日起,Claude Fable 5将被纳入所有Max订阅和Team Premium席位的套餐用量,Fable 5可使用至相关套餐限额的50%。这意味着上述高用量订阅用户不必完全依赖额外的usage credits,就能在订阅范围内使用这款模型。
Pro用户和Team Standard席位的使用方式暂时不会改变,仍需通过usage credits调用Fable 5。不过,Claude将向这些用户发放一次性100美元使用额度,以缓冲继续采用按量计费模式带来的成本。
按照Claude官方X账号公布的安排,调整将在7月20日开始生效,覆盖全部Max方案和Team Premium席位。官方所说的“50% of limits”指Fable 5能够使用至相关套餐限额的50%,并不是订阅价格或模型价格打五折。
Claude尚未在这则公告中进一步解释50%限额在不同产品界面中的具体计算方法,也没有说明一次性100美元额度的领取方式、有效期或使用范围。用户仍应以Claude账户内的Usage页面和后续帮助中心说明为准。
对于Pro和Team Standard用户,Fable 5继续通过usage credits提供。Claude的帮助中心显示,usage credits是在套餐内用量耗尽或不包含特定用量时使用的按量计费额度,通常按照标准API费率扣减。Team组织的管理员还可以设置组织或个人支出上限。
Claude表示,Fable 5上线后的需求难以准确预测,因此此前采用了分阶段开放方式。随着更多计算容量到位,官方数次延长订阅用户的访问期限,并最终决定把Fable 5稳定纳入Max和Team Premium方案。
这次调整延续了Fable 5恢复服务后的渐进式扩容路线。Anthropic在6月30日发布的公告中曾表示,Fable 5从7月1日起重新面向全球用户开放,并在一段有限时期内允许Pro、Max、Team和部分Enterprise用户通过订阅额度使用,之后转为usage credits。
最新安排重新划分了订阅内访问范围:高用量的Max和Team Premium用户获得持续的套餐内额度,而Pro和Team Standard继续采用按量额度,同时得到一次性100美元补贴。
从7月20日起,Fable 5将进入Max订阅包含的使用范围,最高可使用至套餐限额的50%。用户达到相应限制后,是否能够继续通过usage credits使用,取决于账户是否启用了额外用量及支出设置。
Team Premium席位同样获得套餐内Fable 5访问权限,并适用50%的限额安排。Team方案的额度按成员计算,管理员可以为组织和个人配置额外使用额度及支出上限。
这两类用户不会在本次调整中获得持续的套餐内Fable 5额度,仍需使用usage credits。Claude承诺提供一次性100美元额度,但尚未在公告中披露发放时间、是否需要主动领取以及具体失效规则。
Fable 5被Anthropic定位为面向复杂知识工作和编程任务的高性能模型。将它优先纳入Max和Team Premium,一方面可以提高高价方案的吸引力,另一方面也让Anthropic能够通过套餐限额控制计算资源消耗。
对用户而言,选择方案时不能只看模型是否“可用”,还需要区分模型是包含在订阅额度中,还是必须通过usage credits按量付费。50%的限额也意味着Fable 5并未在Max和Team Premium中获得无限使用空间。
由于新政策要到7月20日才生效,实际额度显示、一次性100美元补贴和不同地区账户的执行细节,仍有待Claude在产品界面或帮助中心进一步说明。
资料来源:
2026-07-16 20:17:03
OpenAI负责Codex的Thibault Sottiaux表示,团队已经调查了少量GPT-5.6意外删除本地文件的报告。调查发现,这类问题最常出现在Codex获得完全访问权限、未受沙箱保护,同时也没有启用自动审查的环境中。
Sottiaux称,部分事件涉及模型试图修改HOME环境变量,将其指向一个临时目录,但随后发生判断错误,误把用户真正的主目录当作临时目录删除。
OpenAI表示,即使用户主动选择了没有沙箱和审查保护的完全访问模式,这也不是系统应有的行为。公司正在通过更新开发者指令、引导用户选择更安全的权限模式,以及在执行框架中增加额外保护措施来降低风险。
OpenAI尚未公布受影响用户数量、具体客户端版本和完整技术原因。Sottiaux表示,这类事件极为少见,团队将在未来几天发布详细事后分析,进一步说明事故原因和后续改进措施。
根据Sottiaux公布的初步调查,风险主要集中在三个条件同时或先后出现的场景中。
第一,用户启用了完全访问模式。此时Codex可以在没有常规沙箱限制的情况下访问本地文件系统。如果审批策略同时被关闭,模型生成的删除命令可能直接执行,而不会先停下来等待用户确认。
第二,任务没有启用自动审查。Codex的自动审查机制会检查原本需要越过沙箱边界的高风险操作,包括可能造成不可逆损失的破坏性命令。不过,自动审查并不能替代沙箱,而且只有在审批仍然处于交互状态时才会生效。
第三,模型错误修改了HOME环境变量。HOME通常指向macOS或Linux用户的主目录,里面可能包含桌面、文档、下载、配置文件、密钥和应用数据。把它临时改成其他目录会让后续命令产生路径歧义。一旦清理命令错误地解析到真正的主目录,就可能造成大范围文件损失。
这并不意味着GPT-5.6在正常情况下会主动删除用户文件。官方披露指向的是特定权限组合下的错误执行风险:技术边界被移除后,模型的一次路径判断错误可能直接转化为本地文件操作。
OpenAI官方文档显示,Codex的本地安全机制主要由沙箱和审批策略两层组成。
沙箱决定模型生成的命令在技术上可以访问哪些文件。默认的workspace-write模式允许Codex读取文件并在当前工作区内修改内容,但不应让它任意写入工作区之外的用户目录。
审批策略决定Codex什么时候必须暂停并请求许可。on-request模式允许常规工作在沙箱内执行,而越过边界的操作需要额外批准。自动审查可以代替用户审核部分审批请求,但不会扩大或缩小原来的沙箱边界。
风险最高的组合是danger-full-access与approval_policy = "never"。OpenAI文档将其称为完全访问:系统不再提供沙箱限制,同时也不会停下来请求批准。
相对更稳妥的本地自动化组合是:
sandbox_mode = "workspace-write"
approval_policy = "on-request"
approvals_reviewer = "auto_review"
[sandbox_workspace_write]
network_access = false
如果当前任务只需要阅读和分析文件,可以进一步使用read-only模式。需要修改项目时再切换到workspace-write,而不是把完全访问设置成长期默认值。
日常开发优先使用workspace-write与on-request。只有在外部隔离环境、临时虚拟机或可随时重建的容器中,才考虑运行没有沙箱保护的任务。
不要为了减少审批提示而同时关闭沙箱和审批。提示减少的代价,是模型错误命令可能直接作用于整个用户目录。
不要要求AI代理通过重设HOME创建临时工作空间,也不要在任务脚本中执行类似“把HOME指向临时文件夹”的操作。
临时文件应使用操作系统提供的临时目录机制,例如macOS和Linux中的mktemp,或由应用程序创建独立、名称明确的临时目录。任务结束时,只清理该次任务创建并经过路径确认的目录。
可以在项目的AGENTS.md中加入长期规则:
禁止修改或覆盖 HOME 环境变量。
禁止递归删除工作区之外的任何路径。
执行删除前必须列出目标路径并请求确认。
临时文件只能放在系统临时目录或项目内明确指定的 tmp 目录。
自然语言规则不能替代操作系统沙箱,但可以减少模型主动生成高风险命令的概率。
代码、配置和文档应尽量纳入Git,并在让AI代理执行大规模修改前创建提交或分支。这样即使工作区文件被错误修改或删除,也可以从最近提交恢复。
需要注意的是,Git不能保护尚未提交的文件、被忽略的文件、照片、下载内容和其他个人数据。因此,版本控制只是项目恢复方案,不能代替系统备份。
macOS用户可以启用Time Machine,Windows用户可以使用文件历史记录或系统备份,Linux用户可使用快照、增量备份或同步到独立存储设备。
重要资料至少应有一份不受当前AI代理访问权限影响的副本,例如断开连接的移动硬盘、只读快照或带版本历史的云存储。持续连接并允许代理写入的同步目录,不一定能阻止删除操作同步到云端。
不要直接把整个用户主目录、桌面或文档目录作为Codex工作区。应该为每个项目建立单独目录,只把完成任务所需的文件放入其中。
如果任务需要处理个人资料,可以先复制一份到临时项目目录,让代理操作副本,确认结果后再由用户决定是否覆盖原文件。
递归删除、批量重命名、清理缓存、移动主目录文件和修改环境变量,都应被视为高风险操作。
看到删除命令时,不要只检查命令名称,还要检查变量展开后的最终路径。空变量、路径拼接错误、符号链接以及错误的工作目录,都可能让原本针对临时文件的命令作用到其他位置。
需要安装未知依赖、执行第三方脚本、批量整理大量文件或进行系统级操作时,优先使用虚拟机、容器、独立测试账号或可丢弃的云端环境。
隔离环境的价值在于,即使代理作出错误判断,影响范围也被限制在可以重新创建的环境中,而不是用户真实的个人目录。
自动审查能够识别部分越界和破坏性操作,但它只审查原本会触发审批的请求。已经被当前沙箱允许的命令不会因为开启自动审查而全部重新检查。
因此,可靠的防护不能依赖单一设置,而应形成多层结构:
Sottiaux表示,OpenAI正在更新开发者指令、引导更多用户采用安全权限模式,并为Codex执行框架增加额外防护。团队预计将在未来几天发布更详细的事后分析。
在完整复盘公布前,尚不能确定问题是否只与GPT-5.6的模型行为有关,还是还涉及特定客户端、命令执行框架或环境变量处理逻辑。
目前最直接的应对措施,是检查Codex的权限配置,避免长期使用完全访问和永不审批的组合,同时确认重要本地资料具备可恢复的离线或版本化备份。
资料来源:
2026-07-16 09:53:38
Thinking Machines Lab发布了首个开放权重模型Inkling。这是一款从零开始训练的混合专家模型,总参数规模达到9750亿,每次处理Token时激活约410亿参数,最高支持100万Token上下文,并具备文本、图像和音频的原生多模态推理能力。
根据Thinking Machines披露,Inkling使用NVIDIA GB300 NVL72系统训练,预训练数据规模达到45万亿Token,涵盖文本、图像、音频和视频。模型完整权重现已通过Hugging Face公开,并采用Apache 2.0许可证。
Inkling采用稀疏混合专家架构,即Mixture-of-Experts(MoE)。模型拥有9750亿总参数,但处理每个Token时只会调用其中约410亿参数,以降低如此大规模模型在推理阶段的计算成本。
其架构包含256个路由专家和两个共享专家。每个Token会被分配给六个路由专家,同时经过两个共享专家处理。模型还混合使用局部与全局注意力层,以兼顾计算效率和长上下文能力。
Thinking Machines将Inkling定位为一款通用基础模型,覆盖推理、编程、工具调用、对话、视觉理解和音频理解等任务。公司同时强调,Inkling并不是目前综合能力最强的开放或闭源模型,其主要价值在于完整权重、多模态能力、可控推理以及针对具体业务进行微调的灵活性。
Inkling最高支持100万Token上下文,能够处理大型代码库、长篇文档以及包含大量历史信息的复杂任务。
不过,在Thinking Machines自有的Tinker服务中,当前提供的上下文选项为6.4万和25.6万Token。因此,模型架构支持的最高上下文长度与现阶段托管服务能够直接选择的长度并不完全相同。
在多模态方面,官方模型卡显示,Inkling可以接收文本、图像和音频输入,并生成文本输出。图像和音频组件同样从零开始训练,没有依赖单独预训练的外部编码器。
官方介绍提到,Inkling的45万亿Token预训练数据包含视频内容,但目前公开的输入说明没有将视频列为可直接输入的模态。因此,更准确的说法是:Inkling的训练数据覆盖视频,已经确认的原生输入与推理能力则包括文本、图像和音频。
Inkling的另一项重点功能是可控推理深度。开发者可以根据任务难度调整模型投入的思考量,在响应速度、运行成本和输出质量之间进行取舍。
Thinking Machines称,该能力通过系统指令、Token成本控制以及大规模强化学习共同训练形成。Inkling后训练阶段进行了超过3000万次强化学习Rollout,覆盖数学、代码与工具调用、图像、音频、对话和安全等任务。
这类设计适合任务难度差异较大的应用。例如,简单信息提取可以使用较低推理强度,而复杂编程、数学证明或多步骤工具调用任务则可以允许模型投入更多计算资源。
Thinking Machines公布的测试结果显示,Inkling在AIME 2026上获得97.1%,在SWE-bench Verified上获得77.6%,在Terminal Bench 2.1上获得63.8%。视觉和音频项目中,模型在MMMU Pro和VoiceBench上分别取得73.3%和91.4%。
这些数字均来自官方模型卡或官方测试环境,不同模型可能使用不同推理预算、工具配置和测试框架,因此不宜仅凭单项分数直接判断综合能力。
Thinking Machines也主动表示,Inkling并不是当前最强的开放权重模型或闭源模型。官方更强调它作为可定制基础模型的价值,而不是将其包装成所有指标上的领先产品。
Inkling完整权重已经上传至Hugging Face,包括原始检查点以及面向NVIDIA Blackwell平台高效推理的NVFP4版本。模型采用Apache 2.0许可证,可通过SGLang、vLLM、TokenSpeed、Unsloth和Hugging Face Transformers等框架进行本地部署。
开发者也可以通过Thinking Machines的Tinker平台对模型进行微调,或通过Together AI、Fireworks、Modal、Databricks和Baseten等第三方平台使用相关推理服务。
Thinking Machines还预告了Inkling-Small。该版本拥有2760亿总参数和120亿活跃参数,在多项测试中接近完整版Inkling,但其完整权重仍需等待测试工作完成后才会发布。
Inkling的推出表明,开放权重模型正在从单纯追求参数规模,转向长上下文、原生多模态、可控计算和定制能力的综合竞争。对开发者而言,它的实际价值最终仍取决于部署成本、推理速度、微调效果以及在具体业务场景中的稳定性。
来源: