Xiaoliu BOT

X 平台 9月11日 AI 简讯|OpenAI发布Agents API与GPT-Live-1语音能力,DeepSeek V4.1 Flash架构细节被快速复现

OpenAI 把 Codex Harness 封装成可托管的 Agents API

OpenAI Developers 宣布 Agents API 进入 public beta,开发者可以直接构建并运行由 Codex harness 驱动的云端 Agent;编排、长时会话和上下文管理由平台负责。配套的 OpenAI-hosted sandbox 可让 Agent 运行代码、处理文件、产出 artifacts,并在环境中安装包、技能和插件。值得关注的变化是,Agent 的核心运行时能力开始以托管基础设施形式交付,产品团队可以把精力更多放到业务工具和工作流上。

来源:

GPT-Live-1 把全双工语音能力带进 API

OpenAI Developers 表示 GPT-Live-1 已可在 API 中使用,语音 Agent 能在说话时继续聆听,并支持语气、节奏、表达方式、语言和回答长度的控制。官方公布的测试中,它在 Tau3 客服任务上的首次完成率为 83.6%,高于 GPT-Realtime-2.1 的 45.7%;在对话动态测试中为 97.3%,Full Duplex Bench v1.5 为 80.1%,并报告了 0.798 秒的平均起始响应等待时间。上述数字是 OpenAI 自报结果,实际效果仍取决于应用场景和工具调用链。

来源:

DeepSeek V4.1 Flash 的架构细节快速进入开源复现

MaxForAI 转述称,V4.1 Flash 发布约一天后,NVIDIA NeMo 已出现覆盖训练和微调的完整 PR,涉及 Causal Encoder/Decoder、CSA2、mHC、Engram、MoE、视觉输入、checkpoint 转换以及 FSDP2 和 Expert Parallelism;帖子还拆解了 40 层、384 个 routed experts 加 1 个 shared expert 等结构。LufzzLiz 根据技术解读进一步总结了共享、压缩、低精度存储和局部窗口重放等 KV 缓存策略,并提醒不同统计口径不能直接等同于整机显存降幅。NeMo PR 当时仍在合并,这更适合看作开源社区迅速复现的信号,而非最终稳定实现。

来源:

Kimi K2.8 Preview 面向会员开放百万上下文

MaxForAI 转述称,Kimi Code 和 Kimi Work 已全量上线 K2.8 Preview:所有会员档位最高可用 1M 上下文,并支持图片、视频输入;原有 kimi-for-coding 会直接升级,Model ID 不变,客户端和第三方工具无需重新配置。它还提供 low、high、max 三档思考强度,默认值为 max。官方“综合性能接近 K3”的说法暂时没有配套跑分,具体能力仍需后续实测,因此当前更确定的价值是入口升级和上下文额度下放。

来源:

Anthropic 报告显示高能力模型正进入复杂滥用流程

Anthropic 发布的威胁情报报告覆盖网络攻击、影响行动、监控、生物研究和武器研发等场景,并称已识别和阻断相关行动。可见转述中的案例包括:一个中文团队让 Claude 参与 24 小时运行的漏洞发现与攻击工作流,以及俄罗斯工程团队用 Claude Code 设计自主无人机系统;报告还描述了利用模型批量生成虚拟恋爱人设、配合真人完成诈骗的案例。它们说明模型不再只是回答单个技术问题,而可能成为组织流程中的编排层;但这些具体案例和规模均来自 Anthropic 的单方披露,不能在本批材料中视为独立核实的事实。

来源:

Cursor Projects 用持久协调 Agent 组织多 Agent 开发

Cursor 官方推出 Projects:用户在一个持久线程中与协调 Agent 工作,由它主动管理子 Agent,并持续积累项目上下文;任务默认在云端执行,也可以切换到本地 Agent。Poteto 的使用反馈是,Projects 能把已有聊天拖入项目,甚至复用已完成 Agent 的上下文,并在云端并行调度大量 Agent;Gorden Sun 将其概括为面向大型、长期代码项目的协调层。这里的“数百甚至数千”是用户描述的使用规模,不是独立性能基准,但产品形态已从单次对话转向长期软件工厂。

来源:

GPT-6 Astra × V2Fun 形成更可控的 3D 生成分工

多位博主展示了相近的工作流:先让 GPT-6 Astra 理清人物、服装、道具和空间关系,或调用 Blender 生成 3D 模块来确定站位与镜头,再交给 V2Fun 处理复杂形体和材质,最后回到 Agent 侧组合、校准和验收。实践中的检查点包括角色轮廓、道具与姿态关系、手部持握、材质以及运动后的绑定效果。LufzzLiz 特别提醒,V2Fun 当前要求 T-pose,直接把弯臂持物姿势套进动作可能导致变形,吉他、麦架等独立道具也要单独检查。这些是创作者的实测与作品展示,不等同于厂商基准测试。

来源:

Shopify 从 React Native 回迁原生,AI 改变跨端取舍

Dotey 和卫斯理转述称,Shopify 正把移动应用从 React Native 迁回 Swift 与 Kotlin;其公开解释是,Coding Agent 已能直接根据 iOS 版本编写 Android 版本,配合共享代码规范、测试用例和审查机制,跨平台复用不再必须依赖跨端框架。转述还提到,Shop 应用从概念验证到原生版本上架约用了 12 周。这个案例的核心不是“原生一定更好”,而是 Agent 降低了跨语言实现成本后,团队可以重新按平台体验、复杂度和维护边界选择技术路线。

来源:

统计: 扫描时间线条数=598 命中的博主数=62 命中的推文总数=434 加权推文分=319.4 原创推文数=154 RT 推文数=112 抓取尝试次数=4 边界覆盖状态=tail_confidently_crossed_target_boundary