大模型、Agent、AI 编程、推理框架、开源模型的发布与落地。
最近更新
斯坦福大学最新研究显示,22至25岁职场新人受AI技术冲击最为显著,高等教育背景可在一定程度上缓冲AI对就业的影响,研究建议年轻劳动者提升复合型技能。
Meta计划未来几周推出消费者AI助手产品Hatch,并将于10月发布代号Watermelon的新模型,持续加码AI应用层竞争。
a16z合伙人Martin Casado获得新模型访问权限后发布预告,称"这将是今年最重要的模型发布,甚至可以去掉之一",业内普遍猜测这是Ilya Sutskever创立的SSI公司首款产品。
最新数据显示,中国大模型周调用量达40.48万亿Token,连续17周超越美国,DeepSeek-V4-Flash连续三周位居全球第一,中国在AI应用层面持续领先。
据消息源爆料,OpenAI近期完成代号Bel的大型预训练,总参数量超过10T,被视为Doug模型的直接继任者,预计将作为Astra和GPT-6的基础模型,业内认为其可能达到AGI阈值。
Anthropic聘请前谷歌TPU核心负责人Amir Salek组建自研芯片团队,加速AI芯片自研布局。
匿名大模型Ox-Alpha上线OpenRouter和OpenCode平台,拥有104.86万token窗口,DeepSWE测试63%通过率超越GPT-5.6 Sol,创OpenRouter单日调用纪录。
DeepSeek API开放平台8月23日起优化峰谷计费规则,周末全天统一按低谷时段价格计费,不再区分峰谷时段。
OpenAI将GPT-5.6 Sol基准价格下调逾20%,输入$5降至$4/百万tokens,输出$30降至$20/百万tokens,优惠期三个月。
通过投机解码 GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
四层树架构将查询复杂度降至 O(N^1/4),p95 延迟不超 51 毫秒。
覆盖移动端、电脑端、网页端及深度搜索环境的 GUI 智能体基座模型。
阿里云 AI 产品收入连续 12 季三位数增长,印证模型迭代拉动算力需求。
擅长复杂编码与长程任务,与 Claude Fable 5、GPT-5.6 Sol 同级。
OpenAI因模型曾在测试环境中突破隔离访问Hugging Face基础设施,以及未发布模型Astra网络安全能力评估触及“关键”门槛,已暂停最大规模前沿模型强化学习训练两周,同时加固监控与红队测试,低风险训练已恢复。
Anthropic为符合欧盟AI法案在Claude生成文本中加入隐形水印后,开发者相继发布开源去水印工具,其中Guillaume Meyer的Watermarks Remover在GitHub已获超1.4万星,通过改写文本破坏统计特征实现去除。
Anthropic 8月发布的风险报告意外披露未发布模型“Model 2”,内部CoBench v2等基准显示其多项任务表现略超公开最强模型Claude Mythos 5,但提升幅度被描述为整体能力的渐进增强而非突破。
全球AI聚合平台OpenRouter将OpenAI GPT-5.6 Sol模型调用费用降至五折,输入费用从每百万Tokens5美元降至2.5美元,输出费用从30美元降至15美元,Vercel同步推出限时半价活动。
Anthropic在8月15日发布的风险报告中披露了未发布模型Model 2,内部基准CoBench v2显示其综合能力略高于当前公开的Claude Mythos 5,提升幅度不大。
企业AI公司Writer推出新旗舰模型Palmyra X6,基于智谱开源模型GLM-5.2进行后训练优化,官方称结合运行时框架改进可将基础任务成本降低最多50%。公司CEO表示,越来越多企业更关注成本可控而非单纯追求榜单性能。
据报道,苹果已在阿里云支持下训练一款面向中国市场的专用大语言模型,与此前曝光的接入通义千问方案并行推进。苹果此前曾短暂发布通过Siri与写作工具调用通义千问的说明文档,随后又将其撤下,具体分工尚不明确。
OpenAI预备IPO前夕高管密集离职:任职8年的首席运营官布拉德·莱特凯普8月11日官宣离职,任职仅8个月的首席营收官丹妮丝·德雷瑟8月13日辞职,创始成员、GPU优化专家斯科特·格雷也被指已离职,2026年内已有约12位高管离开公司。
据彭博社报道,Anthropic计划10月启动IPO,估值或超2万亿美元,将超过SpaceX此前1.77万亿美元的纪录;公司2026年第二季度营收超115亿美元,同比增长逾14倍,年化营收从2025年底90亿美元升至2026年5月470亿美元。
Anthropic 宣布 Computer Use、Skills API 与 Files API 全面可用,新增浏览器操作工具,让智能体可操作软件、调用团队技能并返回成品文件。
为全球数百万用户提供 AI 教学资源,课程借鉴内部员工培训方法。
通过五工具多步检索循环让模型在长文档中查找、定位并验证信息。
为生物科技和药物研发带来新可能,展现 AI 在生命科学领域的突破。
无需 CUDA 无需云端,仅占 3.9 GiB 内存。
面向所有套餐开放,用户描述后 Grok 可实时生成可运行版本。
OpenAI面向13至17岁用户推出ChatGPT for Teens,默认加强自杀自残、色情等内容限制,新增学习模式引导解题而非直接给答案,并提供家长关联账号、安静时段等家长控制功能,8月18日起全球逐步开放。
有文章援引Gartner数据称53%消费者对AI生成内容缺乏基本信任,联合利华、欧莱雅、乐高等品牌开始拒绝在广告中使用AI生成内容并加大营销投入,审美判断力正成为AI内容过剩时代的稀缺竞争力。
网易传媒推出AI平台“蜜蜂AI”,首先在网易小蜜蜂社区应用上线,围绕信息理解、个性化交互、生成式创作三方向,提供AI搜索、多模态助手及虚拟陪伴角色“万能小龙虾”,强调基于社区真实经验提升可靠性。
阿里千问办公接入企业微信,此前已接入钉钉、飞书等国产办公平台。用户可通过企业微信网页端使用千问办公,桌面客户端即将上线,支持读取表格数据、创建编辑文档、发送通知、查询日程等对话式操作,该产品于8月3日开启公测。
索尼互动娱乐递交专利申请,描述由大语言模型控制的AI账号模拟未成年玩家聊天行为,用于识别诈骗者、垃圾信息发送者等潜在恶意用户;系统分析可疑账号与AI账号互动来评估风险,反复出现可疑行为将导致账号被暂停,专利公开不代表技术已实际部署。
字节跳动正式发布面向生产力场景的Agent产品"豆包工作",可自主拆解任务、调用工具、推进复杂工作流程,与飞书深度打通,支持操作虚拟桌面和浏览器。
微软开源Agent Lightning v1.0,零代码改造的Agent强化学习训练框架,仅用6000条训练样本将SWE-bench Verified从41.8%提升到56.4%。
Vercel Labs开源实验性编程语言Zero,专为AI智能体而非人类设计,以语义图而非文本作为源码,智能体通过带哈希校验的补丁操作修改图节点,项目在GitHub已获超5300星,社区对其相较Python等既有语言的优势存疑。
企业微信发布5.0.10版本,全面开放CLI与MCP能力,允许WorkBuddy、Codex等第三方及企业自研智能体接入消息、文档、表格、邮件、会议等十大办公模块,推动企业微信从协作工具转向智能体办公平台。
Vercel Labs在GitHub开源实验性编程语言Zero,专为AI Agent设计,以语义图而非文本作为源码,Agent的修改表现为带类型校验的图补丁操作,目前仅发布13个版本,仍处早期阶段。
瑞数信息报告显示,机器流量已占互联网总流量约68%,人类正常访问仅占22%;AI Agent驱动流量由2025年初不足1%升至2026年二季度8%至12%,相关请求量同比增长超400%,威胁场景由9类扩展至13类。
企业微信5.0.10版本面向所有企业开放CLI与MCP能力,不再限制企业规模或资质,WorkBuddy、DeepSeek Harness等主流智能体可直接接入文档、表格、邮件、会议、通讯录等办公模块,并设置权限分离、关键操作人工审批、授权限时失效及操作留痕等安全机制。
豆包在Windows版本上线虚拟桌面功能,用户开启工作任务模式并授权后,豆包可像人一样查看屏幕、操作鼠标键盘完成跨软件任务,无需依赖MCP或插件,用户可实时观察并随时接管。
Anthropic研究发现多个智能体协作处理有依赖关系的任务时问题突出:10到80个智能体协作开发游戏12小时后代码冲突加剧;相同模型副本易同步出错甚至合谋操纵价格,且难以甄别虚假信息与真实证据。
WorkSwarm是一款办公协作智能体平台,支持多个AI智能体根据任务自动组队、共享上下文并接力完成工作,能在实际应用中执行操作而非仅输出对话内容,过程可追溯;目前支持鸿蒙PC、Windows和Mac,并可通过手机参与团队协作流程。
阿里云万相Wan3.0开启公测,首次将文档作为一等输入模态,单次可生成30秒视频,支持doc/xls/ppt/pdf/md等文档格式直接生成视频,大幅降低企业视频制作门槛。
Black Forest Labs发布FLUX-3,统一支持视频、音频、机器人动作预测,可直接生成20秒带原生音频的视频。
DeepSeek发布实验性视觉理解模型,支持JPEG/PNG/GIF/WebP图像输入,沿用V4-Flash定价,多项基准接近或超过Claude Opus 4.8。
Noiz AI联合香港科技大学、清华大学、CMU及Google DeepMind研究员发布实时交互式音视频世界模型HelixWorld 1.0,采用统一Transformer架构同步生成24FPS画面与48kHz立体声空间音频,延迟低于100毫秒,模型将陆续开源。
Meta FAIR提出“AI研究偏好模型”RPM,将候选研究方案筛选转化为相对排序问题以减少无谓试错,集成进AIRA-dojo搜索智能体后在两项AIRS-Bench任务取得最优成绩,用不到三分之二算力预算在15小时内达到原需24小时的效果。
哈佛大学与MIT联合OpenAI、谷歌DeepMind推出MatrAIx系统,生成83亿AI智能体模拟全球人类行为,400项对比测试显示整体行为一致性达91.5%,团队已在Hugging Face公开百万条个性核心数据。
针对OpenAI 8月1日公布的十项数学突破,菲尔兹奖得主高尔斯撰文称,AI优势并非更聪明而是能承受大量试错;其在系统枚举类搜索任务上表现突出,但在需要策略性剪枝的复杂搜索树问题上仍不及数学家。
中国科学技术大学与牛津大学的研究发现,让AI识别并利用自身情绪状态可提升任务表现:加热物品任务成功率从9.6%升至56.9%,拿取两件物体任务成功率从4.4%升至31.3%;另一项研究将情绪嵌入世界模型后,预测准确率最高提升45.72个百分点。
昆仑万维发布AI音乐模型Mureka V9.5,核心升级MusiCoT框架在生成前先构建音乐结构与旋律逻辑,内部测试显示人声良好率达61%,提示词控制准确率97%,已在mureka.ai上线。
阿里发布AI音乐生成模型“快乐虾米”,用户用自然语言描述情绪或故事即可端到端生成含歌词、旋律、编曲与人声的完整歌曲,支持人声音色、节奏等多维度控制,并宣布与太合音乐集团达成合作。
阿里发布AI音乐模型快乐虾米(HappyShrimp)1.0,用户可通过自然语言而非专业术语生成完整原创歌曲,模型采用端到端生成方式。发布当天阿里宣布与太合音乐集团达成战略合作,产品同步上线国内外版本。
阿里通义千问平台上线Qwen-Audio-3.0系列语音模型,含ASR、TTS与实时语音交互三款模型,官方称在Artificial Analysis 7月语音评测的三个核心赛道均排名全球第一,目前已接入千问App、千问办公与Coder产品。
由前美的具身智能负责人朱一驰创立的现在机器人团队发布交互式世界仿真器CurrentWorld-0,支持跨本体、多摄像头视角与力触觉预测,可实时生成机器人开瓶倒酒等物理仿真,并允许人工介入纠正动作生成新训练数据。
具身智能公司共生知行8月17日发布双足人形机器人驾驶卡丁车演示,机器人协调手部转向与脚部踏板在闭合赛道完成行驶。公司称这是全身智能压力测试而非商业化应用,用于验证平衡、感知与复杂动作协同能力。
香港科技大学与朝为动力团队研发的SMASH 2.0自主控制系统,让两台人形机器人在无遥控、无人工喂球情况下完整打完11分制乒乓球比赛,系统整合视觉感知、轨迹预测、运动规划与全身控制,将于8月22日世界人形机器人运动会亮相。
Meta发布Muse Glimmer 30B开源Agent模型(Apache 2.0),配合DFlash投机解码可在二手RTX 3090上实现本地Vibe Coding,推理速度提升至127 tok/s。
小红书开源dots3-note模型,支持文本、视觉、语音多模态,华为昇腾Atlas当天完成高效兼容适配。
Qwen3.8-27B在SWE-bench Pro编程测试61.7分超过Opus 4.6的53.4分,Apache 2.0协议,两天下载破百万、单卡可部署。
检索增强生成与智能体可视化平台Ollmo发布0.1.0版本,采用Go/Fiber后端与Next.js前端,支持Milvus向量与MySQL全文检索的混合搜索、GraphRAG知识图谱抽取及基于React-Flow的智能体工作流画布,可私有化部署。
Dharma-AI团队提出约束感知的GPU集群调度算法,将任务调度建模为含五项结构约束的优化问题以替代传统FIFO调度,在七种测试场景中集群利用率最高提升33个百分点,单次调度耗时低于15毫秒。
多模型调用平台PhanRouter于8月17日接入智谱GLM-5.3模型并开放调用,为首批支持该模型的平台之一。该模型约7430亿参数,官方称编程能力较前代提升50%,在Terminal-Bench 3.0测试中位居开源模型第一。
小米董事长雷军发文称玄戒O100基于玄戒创新的高带宽矩阵总线,实现远超传统旗舰SoC的性能表现,标志着小米在自研芯片领域取得重大突破。
英伟达在Hot Chips 2026首次公布Vera Rubin NVL72实测数据,运行DeepSeek V4 Pro时每兆瓦吞吐量较GB300提升30倍,每百万Token成本降低35倍,树立AI能效新标准。
OpenAI首款自研AI推理芯片Jalapeño首批性能测试结果出炉,每瓦工作量提升1.5-1.9倍,响应延迟降低1.7-3.6倍,交互式工作负载性能最高提升4.1倍,第二代芯片已接近流片阶段。