Seedance 2.5 与 MiniMax H3 的差距,已能用同一提示词做成本和质量对照
同一组提示词的实测已经把 Seedance 2.5、MiniMax H3、happyhorse 1.1 的差异拉到分辨率、价格、表演和连续性等可核对指标上,工具选择开始从“看演示”转向“按任务测评”。@joshesye 用相同视频提示词比较 H3 与 Seedance 2.5:H3 输出 2K、Seedance 2.5 为 720P,记录的使用量为 180 积分对 390 积分,并称 H3 的成本可低至每秒 0.53 元;@LufzzLiz 对 Seedance 2.0、happyhorse 1.1、MiniMax H3 的第一轮测试指出,差异集中在表演、夜景氛围和关键细节,三者都可能先完成大剧情、牺牲细腻表演与连续性。
这类实测对选型更有用:先固定提示词和参考图,再分别记录角色一致性、镜头连续性、分辨率、生成成本与失败样本,不能只用单条成片的观感判断模型。
来源:
- @joshesye: https://x.com/joshesye/status/2084852295607484730
- @LufzzLiz: https://x.com/LufzzLiz/status/2084818491430076693
Cloudflare 正把 Agent 的“钱”和邮件运维做成可调用基础设施
Cloudflare 官方介绍 Wallets 可以存储稳定币、购买服务并接收资金;博主把它进一步解释为给 Agent 配置小额预算,让 Agent 自主试用 API。@xiaohu 举例称,给 Agent 充值约 10 美元,就能处理许多 API 的试用和付费卡点;@LufzzLiz 同时提醒,真实资金托管、安全审计、退款机制、费用和地区政策都尚未成熟,当前更适合预留名称或在测试网上试用。
另一条由独立开发者发布的 Mailworker 基于 Cloudflare Email 与 Workers,试图提供多产品、多域名的收件箱,让 Agent 读取邮件、起草回复,再由人工在 dashboard 中批准发送。项目仍处于 alpha,Cloudflare Email 也被称为 beta,作者明确建议用未绑定主 MX 的域名测试,不要直接投入生产。
来源:
- @Cloudflare: https://x.com/Cloudflare/status/2084648084131242402
- @xiaohu: https://x.com/xiaohu/status/2084839042638872866
- @LufzzLiz: https://x.com/LufzzLiz/status/2084676842146152790
- @iguangzhengli: https://x.com/iguangzhengli/status/2084953958154682693
Open Design 进入 Codex 官方插件目录,Agent 开始和实时画布协作
Open Design 官方账号宣布其 Codex 插件进入官方插件目录,提供直接位于 Codex 内的实时设计画布。@tuturetom 补充称,插件可与 Codex 生态互通,同时允许在 Open Design 中切换模型并保持上下文连续;项目还预告了完整 Demo、8 月 16 日香港线下活动,以及 DeepSeek V4 Flash 的免费无限制使用安排。
这条信息的价值在于工作界面正在从纯文本代码编辑扩展到可视化产物协作。Open Design 社区还出现了持续更新的本地优先、Agent 原生设计工作流书籍,说明这套工具已经开始沉淀教程和使用方法,但插件实际效果仍需结合具体任务体验。
来源:
- @OpenDesignHQ: https://x.com/OpenDesignHQ/status/2084984244762210484
- @tuturetom: https://x.com/tuturetom/status/2084986587088110004
- @tuturetom: https://x.com/tuturetom/status/2084938373035065652
Qwen 3.8-Max 同时带来能力发布、开源预告和价格竞争
Alibaba Cloud 官方发布 Qwen 3.8-Max,称其为 Qwen 家族迄今能力最强的模型,规模达到 2.4 万亿参数,覆盖编程、工作、研究和长任务;同一条信息还预告下周开放 Qwen 3.8-Max 权重,并将 Qwen 3.8-27B 开放权重。@NousResearch 则称 Qwen 3.8-Max 已接入 Hermes Agent,并提供 20% 折扣。
价格侧也出现明显促销:NousResearch 的 Portal 对多数模型打 8 折,GPT-5.6 Terra 和 Luna 打 5 折,DeepSeek V4 Flash 0731 打 1 折。这里能确认的是账号发布的价格与接入信息,不能据此推导模型质量排名或长期价格策略。
来源:
- @alibaba_cloud: https://x.com/alibaba_cloud/status/2084926666774905245
- @NousResearch: https://x.com/NousResearch/status/2084680562300862514
- @NousResearch: https://x.com/NousResearch/status/2084680563756286220
DeepSeek、Kimi 与 SSI 的融资和新模型消息仍应区分报道与确认
@MaxForAI 转述《财经》称,因会议录音泄密事件暂停的 DeepSeek 第二轮融资已重启,计划募资 500 亿元、投前估值约 5000 亿元;同一账号还称月之暗面推进 G 轮融资、估值约 500 亿美元。帖子把这解读为资本从“能不能用”转向押注国产模型能否替代海外闭源模型,但这些数字在本批可见内容中属于博主转述的媒体报道,不是相关公司官方确认。
关于 SSI,@MaxForAI 根据投资人播客转述其可能在 8 月发布首个模型,并联系到持续学习、样本高效学习和英伟达合作;帖子同时明确写出,SSI 尚未公布模型能力、架构或发布时间,“已经破解持续学习”只是外界推测。可追踪的事实是有播客说法和相关合作线索,不能提前写成模型已发布或技术路线已被验证。
来源:
- @MaxForAI: https://x.com/MaxForAI/status/2084907288918438326
- @MaxForAI: https://x.com/MaxForAI/status/2084905969394532536
- @MaxForAI: https://x.com/MaxForAI/status/2084906051909140624
Skills 正从“装得越多越好”转向人工筛选、测试和可收费知识
@oran_ge 表示,团队曾遇到用户安装一万个 Skill 后 Agent 效果变差,因此与 @op7418 合作建立精选站,强调人工挑选、测试和录制教程;@op7418 介绍的 CoLa Skills 商店还提供来源、说明和中文本地化,并按用户需求匹配 Skill,避免把整个庞杂库一次装进 Agent。这里的关键信号是,Skill 的价值开始由可用性、安全处理、解释成本和维护质量决定。
知识产品也在沿同一方向收费。@MANISH1027512 宣布 VSC 社区上线“学院”,首发课程来自长期实战和人工撰写的 GPT-IMAGE 2 教程,随后称课程上架不足 12 小时销售额接近 2 万元。这个销售额是发布者自报,能说明社区内存在为经过验证的方法付费的个案,不能外推成整个市场规模。
来源:
- @oran_ge: https://x.com/oran_ge/status/2084933132416176201
- @op7418: https://x.com/op7418/status/2084929983924023560
- @MANISH1027512: https://x.com/MANISH1027512/status/2084926617349210607
- @MANISH1027512: https://x.com/MANISH1027512/status/2084994221799587981
模型工程开始把结构化输入、上下文管理和数据质量放在同一层讨论
@Gorden_Sun 根据字节 Seed 团队论文介绍,单纯拉长自然语言提示词主要增加冗余,使用 JSON 结构表达位置、深度、姿态、材质和背景等信息,更可能提升文生图质量。@dongxi_nlp 整理的研究线索则分别指向三个问题:随机奖励可能放大既有偏好却不产生真实能力,错误标签会强化错误并削弱探索,Agent 需要自主管理短期上下文与长期外部记忆,预训练数据还可以按样本决定处理方式。
这些内容仍是博主对论文和项目的摘要,不能直接替代论文实验结论;但它们共同指向一个具体变化:Agent 和生成模型的瓶颈不只在模型大小,也在提示词结构、上下文生命周期、奖励信号和数据筛选。
来源:
- @Gorden_Sun: https://x.com/Gorden_Sun/status/2084950115089834022
- @dongxi_nlp: https://x.com/dongxi_nlp/status/2084768262534173033
- @dongxi_nlp: https://x.com/dongxi_nlp/status/2085016112639377415
- @dongxi_nlp: https://x.com/dongxi_nlp/status/2085015920544534682
Agent 应用出现了更具体的内部使用和真实环境测试样本
@xiaohu 介绍 Stripe 的内部 Agent 实践:一名工程师用一周做出面向全公司的 AI 助手 Kai,目标是让非工程员工无需额外配置就能使用熟悉公司内部运作的“AI 同事”。这是一条博主对文章的整理,能支持“内部知识和流程被封装进 Agent”的案例判断,但不能据此确认全公司的具体使用比例。
@steipete 则说明,为了自动化测试 OpenClaw 的 iMessage 集成,给 Codex 接入了带视频能力的远程 KVM,因为 iMessage 在虚拟机中不可靠,已读回执等功能还涉及关闭 SIP。前者展示 Agent 在组织内部的使用对象,后者展示 Agent 在真实系统上的端到端测试约束,落差主要来自环境、权限和设备状态,而非单纯模型能力。
来源:
- @xiaohu: https://x.com/xiaohu/status/2085013960991105112
- @steipete: https://x.com/steipete/status/2084988316324397312
统计: 扫描时间线条数=360 命中的博主数=34 命中的推文总数=205 加权推文分=165.25 原创推文数=93 RT 推文数=36 抓取尝试次数=2 边界覆盖状态=tail_confidently_crossed_target_boundary