折纸乌龟测试:AI生成的视频,到底是完成了任务,还是在自娱自乐?
这篇论文提出了"语义任务完成型视频生成"这一新任务范式,构建了SemComp-Data数据集和SemComp-Bench评价体系,用于检验AI生成视频是否真正完成了指令任务,并与参考图片保持语义关联,而非仅关注画面质量,...
这篇论文提出了"语义任务完成型视频生成"这一新任务范式,构建了SemComp-Data数据集和SemComp-Bench评价体系,用于检验AI生成视频是否真正完成了指令任务,并与参考图片保持语义关联,而非仅关注画面质量,...
Zetta是清华AIR研究院提出的闭环具身智能框架,在冻结底层VLA/GR00T策略模型的前提下,通过在线进化的运行时评判器和恢复技能,把LIBERO-Pro和RoboCasa上的成功率分别提升到90.8%和93.6%,...
这篇论文提出用33维多信号特征结合BiGRU序列模型,把大语言模型幻觉检测从逐词独立判断改造为时序建模问题,在RAGTruth上达到0.840 AUC,相比传统方法提升11个百分点,且无需访问模型内部、可迁移到未见过的生...
这篇论文揭示了机器人世界模型里一个隐藏的矛盾:探针能测出模型"记住了什么",却测不出模型用这些信息做决策时排序对不对。研究者提出Plan-Real Spearman等诊断工具量化这一差距,并设计DA-LeWM方法通过辅助...
FM-Bench让15个顶尖AI模型经营虚拟足球俱乐部长达二十年,通过转会谈判、合同续约、投资决策等长期管理任务,测试AI在信息不完整、后果累积、竞争对手会反应的复杂环境里能否做出靠谱决策,结果显示分数排名与模型规模、价...
这篇论文提出V-RAE,一种基于冻结视觉基础模型构建的视频自编码器,在保持竞争性重建质量的同时大幅提升语义保留能力和生成效果,收敛速度最高提升6倍,并揭示了重建质量与生成质量之间弱相关这一关键发现,提出tFVD作为更可靠...
DiSCO是一种黑盒、训练无关的文生图安全防御方法,通过让模型自己生成安全与不安全图片池,用对比打分和束搜索优化提示词后缀,解决"文字安全但生成危险"的良性对抗问题,在32种系统攻击组合下将平均攻击成功率从23.6%降至...
RTX 5090最低售价已从1999美元涨至逾6000美元,部分渠道报价超9000美元,据称与AI服务器厂商囤货有关,但相关照片被指可能为AI生成,真实性存疑。
City Harvest购入三辆沃尔沃VNR Electric零排放电动半挂卡车,用于布朗克斯区食物救援配送,配备电池供电制冷单元,项目获纽约清洁交通奖1000万美元资助支持。
一名英国卖家在eBay挂出满配HP C7000刀片机箱,含16块搭载Xeon E5-2660的BL460c G8刀片,共128核心1TB内存,标价约700美元,估计价值超4000美元。
美国两党推出Ratepayer Protection Act与GRID Savings Act但均遭阻击,中期选举前难有进展;已有24州自行立法约束数据中心用电成本,推动电力基建向俄亥俄、印第安纳等地转移。
芬兰初创公司S-Transistors宣称实现超导晶体管晶圆级量产,计划2027年推出用于量子计算机低温控制电路的产品,以减少冷却系统中的布线问题。
OpenAI发布Astra for Law,基于GPT-6 Astra打造,专注法律研究与起草,索引覆盖美国案例法、法规等超2.3亿条网址,检索准确率优于普通网络搜索版本。
Anthropic发布三项监测AI发展的具体指标,涵盖AI主导研发占比、自主代理监管及算力分配情况,助力行业协调放缓开发节奏。
BAN报告指出,AI电子垃圾统计过去仅计入服务器,忽略了占比达87%的网络、供电、存储和冷却设备,且硬件被过早淘汰,专家对具体倍数存疑。
Google DeepMind推出DeepMind Institute,发布首批四篇论文,探讨AGI经济影响、模型透明度及前沿AI评估框架等议题。
思科紧急修复Identity Services Engine平台一个CVSS满分10.0的零日漏洞(CVE-2026-76460),攻击者无需认证即可获取root权限,该漏洞已遭在野利用并被CISA列入已知漏洞目录。
作者用AliveMoment工具将老照片转为动态视频,发现儿童合影效果生硬失真,而与祖母的合影动画则情感真实动人,成人照片效果明显优于婴幼儿照片。
英伟达、谷歌与初创公司Emerald AI发起AEMA联盟,推动数据中心根据电网负荷灵活调整用电,并计划制定行业最佳实践标准。