香港大学团队造出史上最严苛AI助手考场:连顶尖模型通过率都不足50%,框架选择竟比模型本身更重要?
香港大学团队推出UniClawBench,一个在真实Docker环境中测试AI助手的能力基准,发现顶尖模型通过率不足50%,框架选择比模型选择对表现影响更大。
香港大学团队推出UniClawBench,一个在真实Docker环境中测试AI助手的能力基准,发现顶尖模型通过率不足50%,框架选择比模型选择对表现影响更大。
上海科技大学团队发现MRI存在最优分辨率"甜蜜点",提出物理感知超分辨率系统PhyMRI-SR,结合高斯泼溅与MRI物理约束,大幅提升低场MRI图像质量。
Agent 已从聊天问答走向真实业务执行,但真正的商业机会不在“万能工具”,而在于能否进入教育、电商、内容、企业服务等具体场景,完成需求理解、流程重构和交付闭环。
密歇根大学研究团队构建CausalDS评测基准,通过合成因果场景检验大模型在数据科学中的因果推理、不确定性量化和弃权能力,揭示六款顶尖模型的能力断层。
初创公司Natural完成3000万美元A轮融资,总融资额达4000万美元。该公司致力于从底层重构支付基础设施,以支持AI智能体自主完成付款、收款及互相交易等操作。现有金融支付体系依赖人工授权,无法满足AI智能体高速自主...
据Gartner最新报告,2024年全球终端用户在AI模型和平台上的支出将同比增长63%,达到640亿美元。随着AI成本上升,CIO们正加强对AI预算的审查,聚焦使用效率、成本控制和可量化成果。受智能体AI驱动,大部分模...
现代汽车与SK On合资建设的50亿美元电池工厂在美国佐治亚州巴托县正式投产,年产能达35 GWh,可满足约30万辆电动车的电池需求。首批电池将用于三排座电动SUV IONIQ 9的生产。该工厂是现代126亿美元Meta...
作者在使用特斯拉FSD(完全自动驾驶)Standard模式行驶时,车辆在50km/h限速路段自动加速至78km/h,被警察开具超速罚单。更令人不满的是,特斯拉在FSD v14版本中移除了用户自定义速度偏移功能,以Slot...
X平台正式发布全新重建的安卓版应用,该版本历时近一年从零开发,承诺在加载速度、滚动流畅度及通知功能等方面全面提升。X产品负责人Nikita Bier将其称为公司历史上"最大规模工程项目之一"。新应用旨在提升全球安卓用户体...
这项联合研究发现阿拉伯语大模型内部存在稀疏的方言专属神经元,并通过神经元激活调整和向量空间注入两种推理时干预方法,无需重训练即可让模型生成地道方言内容,向量导向效果更优。
模型上下文协议(MCP)是AI互操作性的核心基础设施,允许AI模型安全访问外部数据源和服务。下周,MCP将迎来重要更新:改变会话ID的处理方式,采用更接近普通网站的"无状态"方案。现有机制要求服务器记住每个会话ID,在负...
随着气候变化使美国野火季几乎延伸至全年,能够喷洒水和阻燃剂的消防无人机正在加速测试。今夏,加州CAL FIRE测试了5架自主无人机协同作业,合计喷洒500至1000加仑泡沫灭火。Seneca公司的Argo-1无人机可携带...
清华大学与生数科技联合推出Vidu S1,一款支持语音实时控制的虚拟人视频生成模型,可在普通显卡上以42帧每秒输出540p视频,支持无限时长生成且不崩坏。
谷歌母公司Alphabet正在开发一款代号为"Frozen v2"的新型服务器芯片,计划于2028年发布。据报道,该芯片在单位功耗生成Token数量方面,效率将比现有AI芯片提升6至10倍,主要用于优化其自研Gemini...
这项来自上海交通大学等机构的研究构建了IG-Bench评测框架,用"思想基因组"概念衡量AI系统理解科学思想传承的能力,揭示了当前最强AI系统的谱系推理正确率不足30%的关键瓶颈。
这项由字节跳动Seed与香港中文大学联合开展的研究,构建了专用视频推理数据集OpenCoF-17K,训练视频生成模型通过生成连续帧来完成推理任务,并探索了两种推理令牌机制的效果。
阿里于WAIC期间,在千问AI平台和阿里百炼平台同步更新了Token Plan个人版,并推出了参数规模高达2.4T的旗舰模型Qwen3.8-Max-Preview预览版。
科学家警告,随着ChatGPT、Google Gemini等生成式AI的普及,大量AI修改或伪造的鸟类图片涌入iNaturalist、Macaulay Library等公民科学平台。研究人员在《自然》杂志发文指出,数百张...