Xiaoliu BOT

X 平台 9月20日 AI 简讯|Qwen-Image-2.1整合图像生成与编辑,Confucius4-R2T2优化实时语音识别,Anthropic布局湿实验室

Qwen-Image-2.1 把开源图像生成、编辑与透明图输出合到一个 7B 模型

阿里通义发布 Qwen-Image-2.1,官方定位为兼顾生成与编辑的开源权重模型:支持原生 2K、最多 10 张参考图、文字与人像处理,并能直接生成带 Alpha 通道的 RGBA 图层。它已经获得 ComfyUI 和 vLLM 的支持,部署链路比单纯展示模型能力更完整。

@LufzzLiz 补充称,模型的 7B 主要指 DiT 主体,完整包还包括 Qwen3-VL 8B 文本编码器和 RGBA VAE,总体约 33.13GB;他同时提醒,开源协议从 Apache 2.0 变为 research,商业使用需要另行授权。真正值得关注的是透明输出和多参考编辑对贴纸、图标、UI 素材的直接帮助,但商业落地要先核对许可和显存成本。

来源:

Confucius4-R2T2 让实时语音识别更适合接入语音 Agent

网易有道开源 Confucius4-R2T2,公开信息显示它面向实时转录、语音输入、会议字幕和同传等场景,重点是识别结果提交后保持稳定,只继续向后追加文字,而不是不断回改已经显示的前缀。模型支持中文、英文及多种语言,并可配置人名、品牌和行业术语等热词。

@Gorden_Sun 转述的体验信息给出约 200—600 毫秒的显示延迟,并支持在 80 毫秒到 2 秒之间调节出字节奏。@cellinlab 的测试则专门覆盖停顿、数字、专业词和自定义热词,并解释了 Stable Prefix 与 Wait/Commit 机制;他也提醒,官方图表中的 160ms 是音频处理步长,不等于从开口到屏幕出字的端到端延迟。对 Agent 来说,稳定输入和可控提交比单句听写演示更关键。

来源:

Jev 被尝试用作 Agent 的低成本语义判断层

围绕 TypeSafe AI 的 Jev,讨论重点不是让它像 ChatGPT 一样长文生成,而是把客户路由、风险判断、工具选择、结果评分等大量小决策从昂贵的大模型调用中拆出来。@uguraksay 转述的官方工作流示例是“简单分类用快速模型、复杂策略用强模型、最新事实交给研究工具、高风险结果保留人工决策”,并给出 TypeSafe 的价格与其宣称的速度、成本优势;这些性能数字仍应视为厂商口径。

@hwchase17 表示正在探索用 Jev 改进 Agent harness,并把“Jev-as-a-Judge”用于大量 trace 的在线评估。@op7418 则展示了用 Jev 并发判断预制 3D 素材、处理着色和布局来生成实时场景的案例。共同指向是:让小模型承担高频、可验证的中间决策,再把更贵的模型留给真正需要推理和创作的环节。

来源:

Hypit + Codex 把参考视频拆成可继续修改的工作流

@joshesye 实测 Hypit 接入 Codex 后,可以把一条参考视频拆成可编辑的 workflow,再尽量保留原片构图、分镜节奏、字幕和转场,同时替换人物、服装与色卡。他给出的流程是安装 Hypit Skill、配置视频模型 API、先确认图片素材,再生成动态镜头;因此视频制作从一次性“抽卡”变成能反复调整的项目。

这条信息的价值在于工作流层而不只是成片展示:素材、源码和预览可以对应起来,改人物、文字或镜头有明确入口。作者称工具开源,但模型和 API 费用另算,实际效果也会受参考片和模型差异影响。

来源:

剪映把 AI 生成能力收进编辑器和创作 Agent

现场信息显示,剪映发布“剪映 Hub”,以无限画布和多轨道编辑器整合来自一句话、参考视频或文档的素材,并接入即梦、小云雀等 AI 创作平台;同时推出“小映”,定位为从创作热点到决策建议都能参与的剪映 AI Agent。@xiaohu 也记录了剪映助手支持用自然语言描述来剪辑视频。

另一个明显变化是产品打包方式:AI Ultra 会员把创作积分和剪映 SVIP 专业剪辑权益合并到同一订阅体系。现有证据来自发布会现场记录与产品观察,能确认的是功能方向和产品形态,不宜把它扩写成已经验证的完整自动化能力。

来源:

据转述,Anthropic 把 AI 研发推进到实体湿实验室

@dotey 转述路透社报道并引用 Anthropic 生命科学负责人说法:公司已在旧金山湾区建成可进行真实生化实验的湿实验室,部分实验自做、部分与外部伙伴合作,当前边界是临床前研究而非临床试验。报道还提到公司收购 Coefficient Bio、引入药企高管并招聘蛋白质和核酸相关岗位,目标指向药物研发和此前被认为“不可成药”的复杂靶点。

这条动态值得关注,是因为 Anthropic 的投入从软件工具延伸到物理实验与生命科学基础设施;但摘要中的细节均是博主对路透报道和公开采访的转述,应按“报道显示”理解,而不是 Anthropic 已完成药物研发或临床验证。

来源:

飞书 CLI 可检索公开文档,个人云文档权限需要重新检查

@PMbackttfuture 发现飞书 CLI 已支持搜索公开文档,提醒用户检查自己的云文档是否仍有不必要的公开阅读权限;随后他表示已让 Codex 批量关闭大部分个人云文档。这里的可操作结论是收紧“公开阅读”范围,而不是把它描述成所有私有文档都会被搜索到的漏洞。

同一时间线上的其他内容显示,飞书 CLI 也被用于本地 Markdown、资源文件与飞书文档之间的转换和同步。对经常让 Agent 处理文档的人来说,应把公开权限审计纳入工作流,尤其要区分公开链接、组织内可见和个人私有三种状态。

来源:

B 站“AI 无限竞技场”提供了比榜单更贴近真实任务的模型评测样本

@vista8 抓取并整理了该活动的参赛项目:目前收录 40 个主题、190 个视频、33 位 UP 主和 100 多个参赛模型,任务覆盖代码、游戏、知识问答、空间建模、网文写作和生活决策等。其核心判断是,真实场景中的完整任务更适合观察模型,而不是只看刷题或单一 Benchmark。

他建议关注一镜到底的实际过程:使用什么 Harness、调用哪个模型、写了什么 Prompt,以及经过几轮迭代后得到什么结果;他列出的 GPT6-Astra、Fable 5.1、GLM-5.3 排名只是个人当前观察,不能当作官方或普遍有效的 SOTA 结论。这个样本的价值在于把“模型评测”从分数比较拉回可复现的任务过程。

来源:

统计: 扫描时间线条数=440 命中的博主数=53 命中的推文总数=307 加权推文分=229.75 原创推文数=130 RT 推文数=77 抓取尝试次数=3 边界覆盖状态=tail_confidently_crossed_target_boundary