数学家要求OpenAI证明未曾使用他们的研究成果
多名数学家指控OpenAI在宣布重大数学突破前,可能未经许可使用了其与ChatGPT交流中的未公开研究成果,并批评公司回应含糊、缺乏透明度。
多名数学家指控OpenAI在宣布重大数学突破前,可能未经许可使用了其与ChatGPT交流中的未公开研究成果,并批评公司回应含糊、缺乏透明度。
一家企业面对200多个内部应用抢占同一批GPU资源,通过分析生产流量找出指令遵循、工具调用、任务分布三大短板,分别训练强化学习专家再合并权重,最终用320亿参数模型吃下50%流量,超越七倍参数量的大模型,成本降低数倍。
论文提出递归再生数RAI,衡量AI辅助AI研发何时从普通加速转变为自我放大的临界状态,发现该转变取决于反馈结构而非智能水平本身,并揭示多机构网络可能比单一机构更早触发这一临界点。
论文提出SMELT架构,在训练算力、参数量、KV缓存三项预算严格对齐的前提下,让循环中间层两次的MoE Transformer持续跑赢普通模型,最高省下18%训练算力,并揭示第二次循环通过降低注意力沉没提升长文本与上下文...
Arm 开发者关系副总裁 Shantu Roy上台,抛出了一个直击痛点的产业判断:“AI应用的构建,正在从‘以模型为中心(model-centric)’转向‘以系统为中心(system-centric)’。”
上海AI实验室提出Safin-1,通过MARCH架构让循环模型能检索历史状态记忆,并首次将安全能力做成可插拔的持久状态,与上下文记忆共用路由机制,在4B与35B规模上实现能力提升与更优的安全过度拒绝平衡。
论文发现知识蒸馏在中期训练阶段会让语言模型推理能力提升但事实记忆下降,研究者提出按教师预测熵路由的开关蒸馏方法,在保留推理增益的同时几乎完全保住事实记忆,效果延续到后训练阶段。
Pera是复旦大学等机构提出的持久AI智能体架构,主张智能体不仅要完成单次任务,还需持续感知环境变化,主动维护和更新自身服务能力,实现真正的长期陪伴式智能服务。
本文介绍StudentSim框架,通过池化训练与个体特化两阶段方法,训练出既能复现真实学生答题习惯又能响应老师指导的AI学生模拟器,在国际象棋、英语写作、数学三大领域超越GPT-5.4等闭源模型,并可反哺AI辅导老师的强...
多跳问答里,问题和证据的颗粒度常常对不上。Hi-Q提出让证据说了算,先测试查询能否被解决,不能才拆解,还能保证子问题按依赖顺序执行,在多个基准上超过图检索和迭代检索方法。
统一多模态模型能否让视觉理解和生成互相促进?论文从表征、任务、系统三层面揭示:架构设计决定协同或冲突,共享知识的任务能双向提升,端到端模型在复杂任务上优于分步流水线。
ZimaBlue是一个从超12万小时第一视角视频中学习机器人操作能力的世界动作模型,通过三阶段训练和Slow-Fast双系统架构,将零样本任务成功率从36.1%提升到77.8%,同时把控制延迟压缩到33毫秒。
IBM与Lockheed Martin联合苏黎世联邦理工建立瑞士量子创新中心,将于2026年底部署瑞士首台IBM Quantum System Two,搭载120量子位Nighthawk r2处理器,服务化学、材料、优化...
Google、Meta等发现服务器芯片存在静默数据错误(SDE),即使通过传统测试仍会产生计算错误。业界正通过深度功能测试、系统级监测及舰队级筛查等多层手段应对该问题。
随着制程迈向2nm以下,晶体管尺寸缩小、良率余量收窄,测试、量测、检测与制造环节日益交织。先进检测可发现数百万潜在缺陷,区分真实良率风险与正常工艺波动愈发困难,行业需构建跨环节数据流动与冗余设计应对挑战。
SiMa.ai发布行业首个物理AI智能体开发环境Palette Neat,搭配与NVIDIA Orin引脚兼容的Modalix SoM,可复用约90%现有代码,在10W以内功耗运行多个LLM及视觉模型。
英伟达与Palantir合作,基于Foundry平台和cuOpt优化引擎,训练开源Nemotron 3.5 Lightning模型学习专家决策经验,将供应链物料分配准确率提升至86.7%,显著优于更大参数的通用模型。