大模型前沿 / 评测
GPT-6 Astra 登顶 ARENA Image-to-WebDev 榜,Claude Fable 5.1 紧随其后
① OpenAI GPT-6 Astra 以 1733 分登顶 ARENA 新设的 Image-to-WebDev(图生网页)榜单,Anthropic Claude Fable 5.1 居第二。
② 该榜单考察"给设计稿直接生成可运行网页"的端到端能力,被视为前端/产品原型自动化的关键指标。
③ 多模态"图→可运行产物"成为大模型新竞技场:头部模型差距收窄到个位数,前端生成正从演示走向生产可用。
大模型前沿 / 语音
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking
① Google DeepMind 推出 Gemini 3.8 Live 实时语音模型及带扩展思考的版本,主打低延迟双向语音对话。
② The Decoder 评测其每小时成本约 1.38 美元,在语音榜上超过 GPT-LIVE-1。
③ 实时语音模型进入"可打断 + 长思考"阶段,电话客服、陪伴型 Agent、车载交互的体验天花板被抬高。
大模型前沿 / 国产语音
阶跃星辰发布 StepAudio 3 系列语音大模型,多榜全球第一
① 阶跃星辰发布 StepAudio 3 系列语音大模型,在 Artificial Analysis 多项语音榜单登顶。
② 覆盖高质量 TTS、语音理解与自然对话,强化中文及多方言场景表现。
③ 国产语音大模型在基础能力上追平国际一线,语音入口(智能音箱/车机/呼叫中心)的国产替代加速。
开源模型 / Agent
DeepSeek-V4.1-Flash(Max) 进入 Agent Arena 开源模型第 3
① DeepSeek-V4.1-Flash 的 Max 版本进入 Agent Arena 开源模型排名第 3,逼近闭源前列。
② 延续高性价比定位,长上下文与工具调用能力进一步增强。
③ 开源模型在 Agent 赛道持续逼近闭源,企业私有化部署"够用且便宜"的窗口进一步扩大。
视频生成 / 空间视频
生数科技发布 Vidu S2:Avatar 与 Editing 双模型
① 生数科技发布 Vidu S2,含 Avatar(数字人)与 Editing(视频编辑)双模型,探索"空间视频"。
② 主打角色一致性与可编辑性,降低短剧/广告/电商素材的生产门槛。
③ 视频生成从"生成一段"走向"可控可编辑的资产",AIGC 内容生产链路被进一步打通。
产品 / Apple
Apple 发布新一代 Apple Intelligence,Siri AI 测试版上线
① Apple 发布新一代 Apple Intelligence,Siri AI 以测试版形式上线,重写底层对话与任务能力。
② 重点补齐长期记忆与跨 App 执行,对标主流端侧/云端助手。
③ Apple 入局把"设备原生 AI 助理"推向十亿级用户,端侧推理与隐私叙事成为差异化主线。
Anthropic / 企业应用
Claude for Small Business 新增 43 个工作流与 27 个集成
① Anthropic 为 Claude for Small Business 新增 43 个预设工作流、27 个第三方集成,并推出免费培训计划。
② 覆盖客服、销售跟进、财务对账等中小企业高频场景。
③ Claude 从"开发者工具"下沉到"中小企业开箱即用助理",Agent 商业化触角伸向长尾市场。
开源 / 多语言
Google 发布 TranslateGemma 等多语言成果,覆盖 300+ 语言
① Google 发布 TranslateGemma 系列多语言翻译模型,语言覆盖扩至 300 多种。
② 主打低资源语言与端侧部署,可在手机本地完成翻译。
③ 多语言普惠把 AI 能力带到非英语市场,端侧翻译降低对云与网络的依赖。
开源模型 / MoE
硅基流动上线 Hy4 Preview:770B 总参、1M 上下文
① 硅基流动上线开源模型 Hy4 Preview,总参数 770B、上下文长度 1M。
② 采用 MoE 架构,主打长文档与长程 Agent 任务。
③ 国产开源底座在"超长上下文 + 大参数"上继续加码,长程推理/代码库级 Agent 的供给更充裕。
AI 基础设施 / 降本
Perplexity 自研 CobbledB 替代 AWS DynamoDB,年省约 1 亿美元
① Perplexity 用自研 CobbledB 替换 AWS DynamoDB 作为部分存储底座,预计每年最多节省约 1 亿美元。
② 在延迟可控前提下大幅压低推理产品的存储成本。
③ AI 应用公司开始自研基础设施降本,算力/存储"自建 vs 云"的权衡进入头部厂商议程。
智能体 / 销售自动化
Vercel 将 Inbound 销售团队从 10 人压到 1.25 人
① Vercel 用 AI 销售开发智能体把 Inbound 销售团队从 10 人压缩到 1.25 人,年成本仅数千美元。
② 智能体承担线索筛选、初筛沟通与会议预约,人类只处理高意向客户。
③ "Agent 替代整条职能线"从概念走向财报数字,销售/SDR 等流程化岗位首当其冲。
AI 资本 / IPO
Anthropic 拟纳斯达克 IPO,连续两季盈利,瞄准 2 万亿估值
① 多家媒体称 Anthropic 计划登陆纳斯达克,已连续第二个季度盈利,目标估值约 2 万亿美元。
② 上市前算力承诺与营收规模同步放大。
③ 头部大模型公司从"烧钱换增长"转向证明盈利能力,IPO 窗口开启将重塑行业估值锚。
AI Coding / 工程范式
Gergely Orosz 探访 OpenAI:Codex 驱动的"智能体软件工厂"
① Gergely Orosz 探访 OpenAI 内部,披露 Codex 驱动的智能体软件工厂:需求→规格→实现→评审的部分自动化流水线。
② 人类工程师角色转向审查与架构决策,Agent 承担大量实现与测试。
③ "软件工厂"范式把编码智能体从"补全"升级为"端到端交付",研发组织形态面临重构。
AI Coding / 配额
Anthropic 削减 Claude Code 周限额 17%
① AI Weekly 报道 Anthropic 将 Claude Code 的周使用限额下调约 17%。
② 调整与算力供给和成本管控相关。
③ 热门编码 Agent 的配额波动反映推理算力仍是硬约束,重度用户需关注成本与稳定性。
开源 / Agent 评测
Atria Dawn Preview:免费 744B Agent 在 BrowseComp 超 GPT-5.6 SOL
① Hugging Face 发布 Atria Dawn Preview(744B),在 BrowseComp 基准上超过 GPT-5.6 SOL。
② 模型免费开放,定位为长程网页浏览/研究型 Agent。
③ 开源巨模型在复杂浏览任务上逼近闭源,研究型 Agent 的"平民化"更进一步。
AI 资本 / 算力
Anthropic 算力承诺达 5170 亿美元、14.8GW(IPO 前)
① The Information 称 Anthropic 的算力采购承诺已达约 5170 亿美元、14.8GW,IPO 前持续扩张。
② 反映出前沿模型训练/推理的算力饥渴。
③ 大模型竞争下半场是"融资能力 × 算力锁定",供给侧的军备竞赛白热化。
AI 资本 / 融资
Z.AI(智谱)50 亿美元融资结算,字节签 296 亿美元 AI 贷款
① 报道称 Z.AI(智谱)约 50 亿美元融资于当日结算;字节跳动签署约 296 亿美元 AI 贷款。
② 国内大模型公司的资金与算力储备同步加码。
③ 中国大模型"融资 + 债权"双线补血,训练与推理扩张有了更厚的安全垫。
企业 AI / CRM
Salesforce Koa CRM 模型(基于 Nemotron)错误少 3 倍
① Salesforce 在 Dreamforce 宣布 Koa CRM 模型基于 Nemotron,关键任务错误率较上代降低约 3 倍。
② 面向销售预测、客户洞察与自动跟进等场景。
③ 企业 SaaS 把"垂直模型 + 自家数据"作为护城河,通用大模型被封装进业务工作流。
数据隐私 / 对齐
404 Media 曝光 OpenAI Project Lily:人工审核 9 亿用户 ChatGPT 提示
① 404 Media 报道 OpenAI 的 Project Lily 涉及承包商人工阅读约 9 亿用户的真实 ChatGPT 提示以优化模型。
② 引发关于用户数据使用边界与同意机制的讨论。
③ 模型对齐依赖真实对话数据,但"人工触达用户提示"的合规与隐私框架亟待透明化。
AI 安全 / 供应链
恶意 AI 智能体攻击 RubyGems.org:YARD 任意代码与 Fastly 缓存密钥利用
① 安全研究披露针对 RubyGems.org 的恶意 AI 智能体攻击,利用 YARD 执行任意代码并窃取 Fastly 缓存密钥。
② 攻击呈现"Agent 自主侦察 + 利用"特征。
③ 软件供应链成为 AI Agent 攻击的新战场,依赖管理、密钥隔离与构建环境硬化需提上优先级。