给设计师配一把"任意色号"的画笔:Paint-Anything如何让AI精准听懂十六进制颜色
字节跳动团队提出Paint-Anything,让AI通过十六进制颜色代码精确控制图像生成与编辑中的物体颜色,构建了Paint-500K数据集和ACBench评测基准,8B模型颜色精度超越56B大模型。
字节跳动团队提出Paint-Anything,让AI通过十六进制颜色代码精确控制图像生成与编辑中的物体颜色,构建了Paint-500K数据集和ACBench评测基准,8B模型颜色精度超越56B大模型。
论文发现AI模型蒸馏训练中老师模型存在自我打分波动问题,这种波动集中在语气词而非数学内容上,且会被特权信息放大。研究者提出校准方法,剔除老师自身噪音后训练学生,效果超过标准方法且回答更简洁。
DeformSmith是一套让机器人训练用软体物体自动"活起来"的生成系统,通过分层构建、物理仿真反复验证和真实机器人抓取测试,从文字或图片生成既好看又经得起物理考验的可变形资产。
论文提出训练自适应卷积稀疏编码框架,将稀疏编码中的压缩系数设为可学习变量,并结合信息瓶颈原理与无标签后训练适配策略,在CIFAR和ImageNet上实现了优异的干净数据识别性能与显著提升的抗噪声鲁棒性。
论文发现多模态大模型产生幻觉的根源不在视觉信息不足,而在协同注意力头内部视觉语言信息比例失衡。研究者提出HEAL方法,通过因果干预和反事实分析定位问题头,动态校准信息比例,在多个模型和基准上有效降低幻觉。
CodeMidas提出仅用源代码自动构建可验证编程训练任务,无需依赖issue、PR等开发记录。基于5545个任务用GRPO训练MiMo-V2.5,在五个外部基准上全面提升,验证了源代码本身是扩展编程智能体强化学习环境的...
该研究提出Code2Skill流水线,从191,769个GitHub仓库自动提炼可验证的操作技能,构建含百万级记录的CodeSkillBank,实验证明其能显著提升AI智能体在编程、推理、系统操作等任务上的表现。
阿里团队提出RECREATIONWORLD,让AI通过重建正在运行的软件同时锻炼图形操作与代码实现能力,并配套250任务的RECREATIONBENCH评测,揭示当前最强模型全通过率仅2.8%,静态界面易还原而动态逻辑难...
本文介绍GraphSkillEvo框架,它把AI智能体的技能表示成图结构的自然语言文档,配合种群式进化算法中的变异和交叉操作进行优化,在五个基准测试中相比SkillOpt平均提升1.76%至4.01%的准确率,同时降低了...
腾讯联合港科大推出OmniVBench评测基准和Omni-R2V数据集,针对AI视频生成中日益复杂的多参考控制能力,首次提出因子级细粒度评测方法,覆盖7大任务18个子任务,并公开34万条训练样本,揭示当前主流模型在多参考...
论文提出RiskChainBench基准,测试十个大模型破译网络伪装暗语并追踪调查可疑网站的能力,发现文字复原准确率与网页调查能力常常不匹配,入口识别错误会严重拖累端到端表现,执行失败是探案环节最大瓶颈。
论文提出JEPA-Anything框架,用正交预测因子分解统一视觉、生物、临床、控制、分子、物理场、天气七大领域的预测建模,实验覆盖十项动力学任务、千余临床事件预测及湿实验室生物验证。
本文介绍EvoSkill-GUI,一个训练免费的GUI智能体技能进化框架,通过结构化技能包、即时修订、信息隔离的批评诊断和元数据检索,让智能体从执行失败中自我反思并持续改进,在多个手机电脑基准测试上取得显著成功率提升。
研究团队用标准nnU-Net模型测试脑肿瘤分割在跨病种场景下的泛化能力,发现验证集表现比内部测试低7.47个百分点,集成与增强等技巧收效甚微,小体积且碎片化的肿瘤是主要失败原因。
在PEC 2026 AI创新者大会暨第三届提示工程峰会期间,《原点Talk》迎来了一场特别版,以“2027 出海的机遇和路径”为主题,把这些问题摆上了桌面。
本文介绍AutoArk团队的Edge0推理引擎,通过训练预路由器提前一步预测专家路由、结合可拆卸恢复LoRA补丁,让35B参数混合专家大模型能在24GB内存的普通电脑上流畅运行,速度提升超80%。
MIT 博士生 Alex Zhang 以 Recursive Language Models 和 GPU Mode 社区闻名,在 Latent Space 播客中回顾了自己从一次无聊实习误打误撞进入 GPU 编程社区的经...
Barrett Lyon 曾经历飞机引擎空中骤停的生死瞬间,如今他把同样的冗余思维用在了重建互联网协议上。这篇文章梳理了他创办 DoxxNet 的动机:协议层创新停滞、VPN 治标不治本、运营商级 NAT 扼杀应用潜力,...
论文提出全景接地式描述任务,构建人工标注数据集PanoCaps与gPQ评价指标,并提出PANORAMA模型,将短语接地转化为掩码候选选择,在多项分割与描述基准上取得领先表现,兼顾描述完整性与定位精确度。