给同一个词造两张记忆卡:AI 记单词的方式终于学会了"看语境"
论文提出MoME机制,给每个词配多个记忆槏位,让模型依据上下文动态选择读取哪个槏位,解决了传统记忆方法一词多义混淆的问题,在多个模型骨架上验证效果均有提升。
论文提出MoME机制,给每个词配多个记忆槏位,让模型依据上下文动态选择读取哪个槏位,解决了传统记忆方法一词多义混淆的问题,在多个模型骨架上验证效果均有提升。
论文提出EvoOntology,一种给数据智能体用的自我进化知识地图,通过构建者智能体自动生成初始本体、并依据历史执行轨迹持续迭代修正,帮助AI更高效理解异构数据,在多个基准测试中效果显著超越现有方案。
OpenAI ChatGPT 与 Codex 负责人 Tibo Sottiaux 在 DevDay 当天接受专访,谈新产品 Dots 背后的判断:手工搭建的智能体循环终将被淘汰,未来是一个 24 小时在线、不断学习、挣脱...
a16z对话Lio联合创始人兼CEO Vladimir Keil,拆解一张采购价格单背后被系统记录遗漏的邮件、表格与谈判,解释AI原生公司为何仍能撬动老牌厂商的客户,以及代理如何从检索一步步挣得自主决策的信任。
Stripe收购OpenRouter后,创始人Alex Atallah与Replit的Amjad Masad首次公开对谈,揭示企业为何转向开源权重模型、警惕与前沿模型公司深度绑定,以及为何专精模型组合可能比单一"神级模型...
YC Paper Club 上,深度学习老兵 Francois Chaubard 回顾了 NVIDIA 芯片十余年的路线转向,并抛出零阶优化与 SOMA 架构等替代反向传播的实验性方案,重新追问 AI 计算该长什么样子。
Applied Electrodynamics创始人Bill在YC采访中讲述了公司如何用高频天线和无线电波打造出一台能透视干墙、大理石等材料的三维相机。灵感源自一次装修中发现墙后暗藏昂贵隐患的经历,团队仅用四个月就迭代到...
字节跳动团队提出Paint-Anything,让AI通过十六进制颜色代码精确控制图像生成与编辑中的物体颜色,构建了Paint-500K数据集和ACBench评测基准,8B模型颜色精度超越56B大模型。
论文发现AI模型蒸馏训练中老师模型存在自我打分波动问题,这种波动集中在语气词而非数学内容上,且会被特权信息放大。研究者提出校准方法,剔除老师自身噪音后训练学生,效果超过标准方法且回答更简洁。
DeformSmith是一套让机器人训练用软体物体自动"活起来"的生成系统,通过分层构建、物理仿真反复验证和真实机器人抓取测试,从文字或图片生成既好看又经得起物理考验的可变形资产。
论文提出训练自适应卷积稀疏编码框架,将稀疏编码中的压缩系数设为可学习变量,并结合信息瓶颈原理与无标签后训练适配策略,在CIFAR和ImageNet上实现了优异的干净数据识别性能与显著提升的抗噪声鲁棒性。
Sholto Douglas和Nick Marwell是Anthropic强化学习团队的两位核心技术负责人。他们在Joe Lonsdale的播客American Optimist里做了一次将近一小时的对话,录制于2026...
论文发现多模态大模型产生幻觉的根源不在视觉信息不足,而在协同注意力头内部视觉语言信息比例失衡。研究者提出HEAL方法,通过因果干预和反事实分析定位问题头,动态校准信息比例,在多个模型和基准上有效降低幻觉。
CodeMidas提出仅用源代码自动构建可验证编程训练任务,无需依赖issue、PR等开发记录。基于5545个任务用GRPO训练MiMo-V2.5,在五个外部基准上全面提升,验证了源代码本身是扩展编程智能体强化学习环境的...
该研究提出Code2Skill流水线,从191,769个GitHub仓库自动提炼可验证的操作技能,构建含百万级记录的CodeSkillBank,实验证明其能显著提升AI智能体在编程、推理、系统操作等任务上的表现。
阿里团队提出RECREATIONWORLD,让AI通过重建正在运行的软件同时锻炼图形操作与代码实现能力,并配套250任务的RECREATIONBENCH评测,揭示当前最强模型全通过率仅2.8%,静态界面易还原而动态逻辑难...
本文介绍GraphSkillEvo框架,它把AI智能体的技能表示成图结构的自然语言文档,配合种群式进化算法中的变异和交叉操作进行优化,在五个基准测试中相比SkillOpt平均提升1.76%至4.01%的准确率,同时降低了...
腾讯联合港科大推出OmniVBench评测基准和Omni-R2V数据集,针对AI视频生成中日益复杂的多参考控制能力,首次提出因子级细粒度评测方法,覆盖7大任务18个子任务,并公开34万条训练样本,揭示当前主流模型在多参考...
论文提出RiskChainBench基准,测试十个大模型破译网络伪装暗语并追踪调查可疑网站的能力,发现文字复原准确率与网页调查能力常常不匹配,入口识别错误会严重拖累端到端表现,执行失败是探案环节最大瓶颈。