不是每个任务都需要一段生成式回答。有时,系统只需要选对下一步。
OpenAI 于 10 月 6 日发布 Decisions API 测试版,支持 GPT-6 Luna,接收文本和图像,返回概率、预设选项或分数,用于分类与路由。官方称其速度约为 Responses API 的 10 倍;这一性能说法来自厂商,本刊未独立测试。
接口形态的变化很直接:当输出空间有限,开发者可以把“做出选择”单独建模,而不必先生成一大段文字再解析答案。
两则动态,一篇架构读本,一篇论文选读,再加一则科技趣闻。
LESS NOISE. MORE SIGNAL.QUICK JUMP
为理解而读,为实践而选。
EDITOR’S NOTE / 开刊语
让每一步都调用最强模型,并不自动带来最可靠的系统。本期沿着一条线索展开:把有限判断交给专门接口,把高频任务交给合适模型,把运行职责拆清楚,再用真实反馈检验工具链。下面区分官方信息与编辑判断,给出值得继续追问的问题。
THE SIGNAL / 近期动态
不追逐每条更新。
只看改变设计选择的信号。
不是每个任务都需要一段生成式回答。有时,系统只需要选对下一步。
OpenAI 于 10 月 6 日发布 Decisions API 测试版,支持 GPT-6 Luna,接收文本和图像,返回概率、预设选项或分数,用于分类与路由。官方称其速度约为 Responses API 的 10 倍;这一性能说法来自厂商,本刊未独立测试。
接口形态的变化很直接:当输出空间有限,开发者可以把“做出选择”单独建模,而不必先生成一大段文字再解析答案。
小模型的价值,不只在价格,而在能否可靠地承担重复工作。
Anthropic 于 10 月 7 日推出 Haiku 5.5,面向摘要、上下文压缩、分类与编码子代理,并首次为 Haiku 引入 effort 设置。官方仍建议复杂的 agent 编码工作使用更大的模型。
输入不超过 10 万 token 时,每百万输入 / 输出 token 的价格为 0.10 / 0.50 美元;超过这一门槛时为 0.50 / 2.50 美元。分工策略因此也要考虑上下文长度,而不只是调用次数。
Agent 的推理循环、执行环境和产品服务,是三件互相关联、却不该混为一谈的事。
OpenAI Agents API 的架构文档把它们拆开:harness 负责模型与工具循环、会话;environment 提供计算与文件;application server 负责产品集成、提交任务、处理事件及函数工具。
执行环境并非所有应用都需要。但采用自托管环境时,资源创建、重新连接、关闭与文件保留,都需要被纳入生命周期设计。一次请求成功,并不能说明这些后续环节已经可靠。
应用侧应持久化任务进度、等待原因与结果,为写操作设计幂等机制。测试也要覆盖“客户端断线”和“工具超时之后怎么办”:能否恢复任务、避免重复写入,并让用户知道当前状态?
THE READING ROOM / 论文选读
读方法,也读实验边界。
本篇为选读,非当日新论文。
与其先写一个问题、再赌工具链能跑通,不如从真正执行成功的路径开始。
ToolGrad 先执行候选 API、评估结果,再扩展有效工具路径,最后合成匹配的问题与答案。这里的“梯度”是文本反馈,用来指导搜索,并非微积分意义上的梯度。
论文构建 ToolGrad-500 数据集,并微调 Gemma-3 的 1B、4B、12B 模型。其数据生成通过率为 99.8%,DFS 基线为 63.8%;平均有效工具使用次数为 3.4 与 2.1。注意:前一指标衡量数据生成,不能解读成 agent 的任务成功率。
这条路线值得用于内部工具训练数据的冷启动,但最终要留出真实用户任务做验证。ToolBench 与 BFCL 实验仅涉及单轮交互;多轮效果、缺少推理示例、合成语言与真实表达的差距,以及数据扩展后的收益趋缓,都是方法的边界。
阅读提醒:论文初版发表于 2025.08.06;本期阅读 v3(2026.06.17),并参考 2026.09.10 的 Google Research 解读。
这次赛车更新的主角之一,是便利店和蛋沙拉三明治。
Xbox 10 月 8 日宣布,《极限竞速:地平线 6》的 Horizon Meets 更新加入以日式 7-Eleven 为灵感的门店与主题车聚。玩家可以穿上店员制服,还能通过道具包把整家便利店放进 EventLab 自建赛道。
更有画面感的是秋季挑战:撞碎 20 个蛋沙拉三明治收集物,就能获得嘉年华播放列表完成进度及 Forza LINK 奖励。以上为官方公布的限时游戏内容,本刊未进游戏体验;具体活动开放情况以游戏内信息为准。
BEFORE YOU GO / 收刊