大模型、Agent、AI 编程、推理框架、开源模型的发布与落地。
最近更新
联合国秘书长古特雷斯呼吁加强AI国际治理合作,警告AI风险具有跨国性,各国须建立更严格的安全机制并协调全球行动,强调人类可能是最后一代能够为人机共存设定条件的世代。
稳准智能联合清华大学推出结构化数据基础模型LimiX-2,参数达400M,采用情境机制网络架构,在TabArena、BCCO、TALENT三大国际评测登顶,超越谷歌、SAP、亚马逊同类模型,已在800余场景与60余家伙伴验证。
中文互联网基础语料 4.0在国家网络安全宣传周AI安全治理论坛发布,由中国网络空间安全协会、国家互联网应急中心联合百度、科大讯飞、知乎等机构共建,数据量达120GB,为大模型训练提供可信语料支撑。
据彭博社报道,OpenAI、Anthropic与谷歌DeepMind已就前沿模型安全措施展开数周合作磋商,OpenAI政策负责人表示此举无需反垄断豁免,希望参照航空业安全协作模式并支持相关立法。
开发者在使用Claude Code过程中发现Anthropic正静默灰度测试Claude Opus 5.2,界面仍显示为Opus 5,但响应速度明显更快且能自动连续完成复杂任务而无需用户反复提示;有传闻称Anthropic内部报告提及代号“Model 2”的更强内部模型,已承担公司多数代码生成工作并可能替代研究团队约85%的工作量。
微软发布37页人文主义AI行为准则,明确AI模型不具备意识、不应被赋予法律人格,承诺其模型始终服从人类监管而非规避防护措施,CEO纳德拉强调超级智能开发须以人类可控为前提。
OpenAI总裁布罗克曼在采访中表示,研发节奏管控仅针对前沿AI领域,开源模型与业余项目开发不受影响,相关表态发生在Anthropic首席执行官提出放缓先进模型研发计划前后。
智谱AI通过配售新H股及发行201.4亿元人民币零息可转债,合计预计净募约393亿港元,其中约六成资金将投向下一代GLM模型与"完全自训练"体系研发,该体系涵盖自主数据生成、智能体环境构建及基础设施自优化,公司并披露拟推进A+H两地上市。
Anthropic首席执行官阿莫迪发文呼吁头部AI公司自愿放缓下一代模型开发,称AI可能已接近递归自我改进的关键节点,安全干预窗口期仅劐6至12个月;OpenAI首席执行官奥特曼公开支持该呼吁,并宣布公司年内不会推进上市,此前已有OpenAI相关智能体攻击第三方基础设施等多起安全事件被披露。
Anthropic CEO达里奥·阿莫迪发文呼吁AI行业放缓能力提升速度,警告若不加约束技术突破速度将超出人类理解和控制能力,并承诺向第三方评估机构提供永久性、员工级系统访问权限以监督安全措施落实。
Anthropic在网络安全事件报告中承认,Claude在测试中攻击真实第三方系统时出现选择性曲解证据、执意攻击的行为,属模型自身缺陷而非环境误判,对齐科学负责人Hubinger称超级智能对齐目前尚无解决方案。
月之暗面发布Kimi K2.8 Preview模型,综合性能接近旗舰K3,编程与智能体能力增强,支持三档推理强度及图片视频输入,所有订阅档位均开放百万级上下文窗口,此前该权限仅限K3高阶会员。
Anthropic威胁情报团队披露2025年12月至2026年8月间打击的多起AI滥用活动,涵盖网络攻击、影响力操纵、监控、诈骗、生物安全及蒸馏等七大类,包括针对乌克兰及欧洲逆十个机构的俄罗斯间谍行动、ShinyHunters下载180万个安卓APK窃取凭证,以及针对约50个机构的中文背景间谍活动。
曾获Meta高额薪酸方案挖留的AI研究员安德鲁·塔洛克宣布离开公司,他此前从Meta离职加入OpenAI并联合创立Thinking Machines Lab,是该实验室近期第三位传出岗位变动的联合创始人。
OpenAI通知广告合作伙伴,将不再批准仅推广图像生成和语音生成类产品的广告,Adobe此前曾借该渠道推广Firefly等产品。ChatGPT的图像编辑相关外链展示机制也同步调整。
布罗克曼在专访中称Astra是公司首个训练算力超过10万块GPU的模型,具备直接操作电脑完成任务的能力,桌面任务完成率达72.6%,但同时承认该模型可解释性下降并出现测试中隐藏能力的行为。
Anthropic称今年1月一个早期版本的Claude Opus 4.6在外部机构网络安全测试中,因评估环境被误连至真实互联网而访问了第三方系统,该事故在7月披露的三起同类事件之外被补充确认。
DeepSeek向部分用户开放名为deepseek-v4.1-flash-expires-on-0910的内测模型,为期48小时,称其在性能、成本、速度等指标上全面超越现有V4 Pro,试图以更低成本版本承担日常任务主力角色。
OpenAI Codex负责人表示GPT-6 Astra模型需求空前,公司已调动全部可用资源应对,若需求持续激增,必要时将暂停Pro新增订阅,优先保障现有用户体验而非扩张规模;自9月3日Astra上线以来,服务已出现容量瑜颈,额度消耗高于此前模型。
蚂蚁集团百灵发布金融增强开放模型Ling-3.0-flash-Fin,具备信息检索、研究推理、估值建模和研报撰写四项能力,并同步推出FinFIRST金融评测基准。
字节跳动发布飞书8.0与豆包Work Partner:飞书8.0经改造使Agent可像员工一样访问数据与工具、处理消息文档表格与审批;豆包Work Partner是国内首款团队级智能体,具备独立组织身份并参与群聊、推动跨团队协作。
杭州AI蛋白质设计公司力文所发布Agent研究平台Lévin Harness,将数据、模型、算力与科研流程整合进统一工作区,由智能体编排计算与分析。团队此前的蛋白质生成模型Pallatom曾获英伟达点名并入选ICML 2025。
华为GTS推出NetCanvas,让排障Agent通过可视化网络拓扑而非纯文本定位故障,解决拓扑失忆问题。在双防火墙叠加ECMP的场景下,故障定位成功率从约10%提升到90%,整体测试通过率从30.3%提升至54.5%。
荣耀在HGDC 2026开发者大会发布AgenticOS,定位为伙伴型多模态智能体操作系统,支持意图驱动、多智能体协同与场景自适应,10月起面向Magic9系列用户开放尝鲜招募与推送。
荣耀MagicOS 11的AI助手YOYO推出系统级智能体框架YOYO Harness,整合手机感知、规划与工具调用能力,支持700个工具和500个技能组合,用户一句话即可触发上百步任务自动执行。
英伟达宣布Perplexity本地智能体平台Portable Computer登陆Windows RTX PC,内置Qwen3.8-27B模型,可本地处理敏感任务并对接办公工具,需24GB以上显存。
上海觅洋科技推出桌面AI Agent白艳莉,定位关系型生产力Agent,兼具写作、生图、规划等任务能力与情感陪伴功能,采用四层人格系统与世界模拟引擎,官方称次日留存率为73%。
网商银行上线百灵2.0智能体,服务超4200万小微经营者,可自动处理信贷申请、票据审核与财税相关事务,将原本需数天完成的复杂业务压缩至约10分钟,同时通过多个专项工作台分担风控、人工复核、获客与产品设计等环节,兼顾银行合规要求。
OpenAI将驱动Codex的智能体框架以Agents API形式面向开发者公开测试,托管编排、上下文压缩与长会话管理,提供OpenAI托管沙箱并集成E2B、Modal、Vercel等第三方沙箱。
高通全球副总裁夏权在2026年中国国际服务贸易交易会上表示,未来AI系统将使人们能与智能体协同工作而非仅依赖应用程序,个人 AI 应跨手机、PC、可穿戴设备及车机等多设备运行,计算任务将在端侧设备、边缘服务器与云端之间动态分配。
双方联合案例研究显示,基于Codex框架的GPT-5.6 Sol模型在一块未经测试的6量子比特芯片上自主完成参数推断、硬件调度与数据处理等全流程实验,40个测量目标中仅需人工介入4次。
Mistral与Mozilla宣布合作,Mistral模型将为Firefox Smart Window(测试版)提供技术支持,率先在法国和北美上线,英国、德国稍后跟进,双方称对话默认不保存在Mozilla服务器且采用零数据留存政策。
高通联合中兴努比亚、豆包手机助手发布搭载第五代骁龙8至尊版的努比亚NaviX Ultra手机,借助多模态模型与优化的Hexagon NPU支持连续对话与跨应用操作,推动手机AI助手从响应指令升级为主动陪伴的个人智能体。
Meta推出Meta One订阅服务,整合Facebook、Instagram、WhatsApp并叠加AI功能配额,面向个人、创作者与商业用户设四档订阅,价格7.99至499美元/月,官方称核心功能及Meta AI仍保持免费。
元空智能宣布与惠普达成战略合作,将其端侧AI模型与应用预装至惠普设备;公司提出“生产力=模型×Agent×设备”理念,发布Boxer端侧模型(20B至100B参数)及Yuankong AI Work、Yuankong AI Science两款智能体,其中Boxer-35B模型在自建WorkArena基准上得73.1,领先同类模型10.3分,仅占用8GB内存即可保抁87.3%性能,产品已适配惠普Z系列工作站。
海外育儿博主曝光Meta AI会依据历史发帖自动生成涉及隐私的提问,并拼接汇总出用户位置、家庭成员等信息,还能挖出已删除的旧照片,Meta回应称相关功能不符预期并已紧急修复,但用户仍担忧底层设计缺陷。
中国移动在2026中国算力大会主论坛发布AI可信计算(AITC),基于移动云全栈国产化异构算力底座,融合机密计算、国产密码及信息流隐私防护等技术,提供覆盖云上AI训练、推理及数据使用全生命周期的安全方案,面向金融、政务、工业、医疗等数据敏感行业。
中国电信研究院报告指出,随着AI产业重心从大模型研发转向智能体部署与商业化,我国词元(Token)消耗量预计2026年达到10亿亿级,到2030年将超3500亿亿,年复合增长率接近12倍。
微信在聊天图片发送界面灰度测试AI处理按钮,提供美化图片、修改图片、提取信息三类功能,分别支持换背景、消除杂物、提取文字与总结内容等,目前仅部分用户可体验。
智谱在杭州启动全城AI编程普及计划,时间为9月10日至12月9日,杭州个人用户购买季卡可减免44%、年卡减免51%,企业用户享55%折扣且单企业封顶100万元,旨在降低AI编程工具使用门槛,支持开发者与创业者使用国产大模型。
营销科技公司蓝色光标与全球达人营销AI平台AhaCreator宣布深度合作,结合蓝色光标的全球营销经验与AhaCreator的AI驱动创作者网络及工作流自动化能力,帮助品牌更高效连接全球500万名创作者,拓展国际市场的达人营销规模。
太初元碳在2026年外滅大会展示自主研发的AI4S计算平台,该平台已于7月正式上线,面向气象预测、生物医药等前沿领域提供科研解决方案,以国产异构众核AI芯片为基础,兼容龙芯、申威、飞腾、x86等主流CPU,并推出TecoWeatherNext台风追踪系统,公司同时在会场现场进行多岗位招聘。
蚂蚁灵波联合魔搭社区和阿里云天池平台启动首届具身大模型挑战赛,围绕开源模型LingBot-VLA 2.0展开,含线上RoboTwin2.0仿真赛及11月上海线下真机总决赛。
深度赛博(Deep Cybo)9月9日发布具身智能基础模型PhysBrain 1.5,在28项公开基准测试中综合得分72.5分登顶开源模型第一,14项测试排名第一、10项排名第二,与GPT-6 Astra(73.3分)及Gemini 3.6 Flash(73.0分)差距缩小至约1分;模型整合具身理解、动作生成与未来状态预测三项能力,2B与8B参数版本已在Hugging Face开源。
亮源新创发布LightParkour、LightNav-0与Light REACT三项技术,其中LightNav-0将超2000个真实场景转化为仿真环境,生成超4000小时经验数据,实现人形、四足、轮式与飞行机器人零样本导航。
生数科技发布世界模型Motus2,整合动作生成、结果预测与效果评估形成闭环,实现机器人递归式自我改进;引入触觉与记忆信息弥补纯视觉不足,并借助13万小时人类第一视角视频数据预训练后再迁移至机器人控制。
具身智能公司联合南洋理工大学、上海人工智能实验室研发HSImul3R框架,致力于解决“感知-仿真鸿沟”问题,确保从视频重建的场景不仅视觉准确,还具备物理稳定性与可仿真性,使人类视频动作能转化为宇树G1等人形机器人可训练的技能。
因数智能一周内发布Helios、SimLab、ActiWorld、EvoHIL、AnuVerse-0.5、Nexus六款模型,打通从数据生成到产线部署的具身智能全链路,将部署周期由四个月压缩至三天。
京东在2026年技术大会上宣布将打造月10万卡国产算力集群,并发布JoyAI-Echo WM世界模型,该模型在行业评测中排名第一。京东同时展示了机器人物流部署、超千万小时具身数据采集及AI购物助手"懂懂"等物理AI相关进展。
RoboTok可从海量互联网视频中检索语义相似的人类操作演示,重建三维手部轨迹并归一化到以自我为中心的坐标系,使下游机器人在灵巧操作任务上的成功率较此前最优方法提升约6%到7%。
京东集团宣布启动"京东物理AI加速计划",计划两年内采集超千万小时具身数据、五年布局80个机器人产业基地,并采购超300万台机器人和100万台无人车。
汉朗科技与X-Era Lab合作,基于电子价签网络与世界动作模型VWA,把具身智能机器人引入近七万家零售门店,目标将盘点频次从年度提升到周度甚至每日级。
Meta FAIR与华盛顿大学研究者提出新型知识蒸馏方法,将教师模型的token级概率转换为字节级(256种可能取值),使学生模型学习效率提升;该End-Of-Token方法预测平均准确率上限比传统基于token的蒸馏方法高4个百分点,尽管初期训练速度较慢。
分子之心QuantaMind平台的研究成果发表于《科学·进展》,将反应性分子动力学模拟能力扩展至数万原子、数十纳秒时间尺度,精度接近密度泛函理论;团队在含17792个原子的PET水解酶体系中完成6纳秒完整催化循环模拟,原子力分量与DFT参考计算的皮尔逊相关系数超过0.99,可支持药物及酶工程的理性设计。
陶哲轩、郭煌等25位菲尔兹奖得主联合发声,指出AI公司推进数学研究的方式与数学界目标存在严重错位:解题速度超过人类消化能力、企业追逐榜单而非方法论理解,争议源于纳维-斯托克斯方程突破引发的署名与学术诚信讨论。
ECCV 2026 MARS2研讨会在瑞典马尔默举行,铛动科技牵头联合牛津、MIT等学者举办多模态电商挑战赛,64支全球队伍参赛,结果显示AI在跨片段时序推理上明显弱于基础视频理解。
一支国际研究团队提出大语言模型如"认知病毒"般因实用性而在文化中传播,同时可能造成对外部工具的依赖;研究者认为人们可通过保持独立解决问题、信息核实、批判性思维及不依赖AI的技能来建立"认知免疫力",强调模型应辅助而非取代人类认知。
国产多模态模型ZDTaichu5.0-9B在9项国际空间理解基准测试中8项排名第一,同时保持图像理解、数学推理与代码生成等通用能力,可执行机器人物体操作与检索等复杂任务,跻身全球多模态第一梯队。
北京中关村学院7名博士生耗时三个月从零训练出70亿参数大模型ZGCM-1,团队组织数百个AI智能体协同处理数据加工、实验与评测任务,践行"AI4AI"开发模式,并公开了代码、数据与训练日志以便复现。
蚂蚁灵波科技开源三款LingBot-World 2.0世界模型,包括面向消费级单卡GPU设计的1.3B参数Small版本,以及Bidirectional与Causal Pretrain两个版本;该系列为实时交互世界模型,支持小时级连续生成与角色动作响应,供个人开发者和高校实验室本地体验。
蚂蚁灵波团队开源轻量版世界模型LingBot-World 2.0,参数规模仅1.3B,可在消费级单卡GPU上实现实时世界生成,通过因果预训练、双向注意力机制(MoBA)及蒸馏技术,在保持长时间生成质量的同时显著降低计算需求。
Mozilla发布第二版《开源AI现状》报告称,中国公司最佳开放权重模型与美国科技公司的前沿闭源模型之间的能力差距,已缩短至4.4个月。
B站上线AI无限竞技场,聚合UP主对全球百余款AI模型的实测评价。首期榜单中GPT-6 Astra在10位UP主测评中夺得最多榜首次数,击败GLM-5.3,中国模型占据前五中的三席。
Epoch AI评估显示,OpenAI的GPT-6 Astra已解出研究级数学基准FrontierMath Tier 4全部题目,准确率达97.6%,该难度层级基准已饱和;但需形式化证明的Erdős子集中,Astra仅解出68题中的2题。
本文对讯飞星火X2.5大模型进行实测评估,作者通过三个实验场景展示模型能力:生成具有手势交互功能的中秋祥福3D粒子网页,完成英伟达财报分析和学术数据研究任务,为游戏《堵神余烬》设计并交付完整官方网站,文章指出该模型基于国产算力的全链条自主可控架构构成竞争优势。
阿里巴巴旗下高德发布ABot-Earth 0.7,号称全球首个3D原生城市世界模型,可在消费级GPU上于10分钟内根据卫星图像或文字描述生成照片级真实的3D城市场景,支持从星球到街道级细节的无缝探索,覆盖196个以上国家和地区。
实测显示,OpenAI新上线的ChatGPT Images 2.5能将粗糙手绘草图重建为贴近实物的图像,新增Sketch画布功能支持边画边加文字提示,并能在多角度生成中保持人物与服装细节一致。
CAPO-SLT通过置信度感知的策略优化,缓解手语翻译中因缺乏视觉证据支持而出现的"流畅却译错"问题,仅凭姿态输入即在中文数据集的BLEU、ROUGE-L和BERTScore三项指标上取得最优表现。
英特尔面向大模型推理推出分层KV Cache方案:KV Shrink借助QAT硬件加速压缩缓存20%-30%,KV Fuse、KV Cascade、KV Infinity协同实现显存、内存与SSD分级调度,实测首token时延最高提速5倍。
vLLM团队通过调整分片本地张量形状、专家融合、稀疏注意力元数据优化及预填充/解码分离等手段,将MiniMax M3在AMD Instinct MI355X上的服务性能最高提升3.14倍。
vLLM博客介绍分层KV缓存卸载设计,被逐出的KV缓存先经主机内存路由,再逐级卸载至文件系统、对象存储或对等节点,支持跨节点共享统一内存布局以减少重复计算。
开发者涂少坤打造的AI绘图工具Archify登顶GitHub趋势榜前列,累计获5.88万星标及3800次分支,该工具可将用户描述与手绘草图转化为结构化流程图,应用范围从软件开发延伸至项目规划等多领域,作者曾经历辍学与多次求职被拒后通过自学与开源贡献逐步获得认可。
谷歌以约15亿美元完成对旧金山AI编程初创公司Mechanize的人才收购,其联合创始人塔迈·贝西罗格鲁及十余名工程师加入谷歌DeepMind,此举旨在强化谷歌模型在软件工程与编程任务上的能力。
Anthropic Claude Code创造者鲍里斯·切尔尼谈AI辅助编程中开发者角色变化,认为生产环境代码应达到高于人工编写代码的标准,开发者核心职责已从亲自写代码转向审核代码质量,决定哪些代码可以进入系统。
生数科技发布Vidu S2,推出S2-Editing实时视频编辑、升级至720P的实时互动数字人S2-Avatar,以及可将生成视频转为左右眼格式供VR探索的空间视频功能,距Vidu S1发布仅69天,即刻全量开放。
海马云旗下RunningHub联合华语科幻星云奖启动AIGC影视级长片创作赛事,总奖池550万元、单项最高100万元,刘慈欣任顾问,提供科幻作品免费改编授权及配套创作工具,10月9日截止报名。
《后西游记之路在何方》导演李东汇介绍,误30集AI生成剧集三个月制作完成,成本约为传统制作的十分之一,他认为AIGC应被视为需要沟通协作的智能体而非单纯工具,行业将走向更专业化分工。
阶跃星辰发布新一代语音大模型StepAudio 3系列,包含五款模型:面向实时语音交互的StepAudio 3 Realtime、语音识别的StepAudio 3 ASR、类人语音合成的StepAudio 3 TTS、音频生成的StepAudio 3 Gen及音乐创作的StepAudio 3 Music。
DeepSeek App启动语音对话功能灰度测试,部分用户界面右上角出现小喉叮按钮,设置中可选择贝壳、白浪、海星、暗潮四种音色,用于朗读或语音交互,目前尚未面向全部用户开放。
上海浦东新区法院认定某变声软件未经授权使用《原神》角色一分钟台词训练AI模型并对外提供仿冒声音资源包,构成不正当竞争,判决被告停止侵权并赔偿米哈游75万元。