泰语TTS的"蒸馏"实验:如何用15秒的声音训练出一个82M的语音模型
本文解读了一份泰语语音合成技术报告,研究团队用大型声音克隆模型OmniVoice处理15秒参考音频生成合成语料,训练出仅82M参数的固定音色学生模型Wayu-Paxa-TTS-Edge,在关键词准确率和停顿精度上部分超越...
本文解读了一份泰语语音合成技术报告,研究团队用大型声音克隆模型OmniVoice处理15秒参考音频生成合成语料,训练出仅82M参数的固定音色学生模型Wayu-Paxa-TTS-Edge,在关键词准确率和停顿精度上部分超越...
Benchmark Radar是一个每日更新的AI基准测试搜索引擎,整合1283条来自四大权威源的评测记录,揭示近四成基准无分数、分数量纲难比较等真实问题,帮研究者查清评测证据来源。
机器人操作模型在实验室里表现优异,但换个摄像头角度就大幅失效。本文提出的潜在接口训练方法,通过先无图像训练动作逻辑、再用姿态监督的窄通道引入视觉信息,在四种主流架构上均提升了泛化能力,真实机器人实验成功率提升超60个百分...
视觉文档检索靠“后期交互”实现高精度,但每页要存上千个向量,存储代价巨大。KAUST团队发现向量分布其实只有五六维自由度,提出GLIE,仅存4个向量即可复原全部信息,压缩比大幅提升且无需重训模型。
研究者发现视频AI能看懂视频"发生了什么",却分不清"什么时候发生"。TempCloze通过让AI从视频片段中挑选正确的缺失中段,揭示了当前视频大模型在时间对齐能力上的系统性短板,远逊于其内容识别能力。
这篇论文提出EvoSafeHarness框架,针对不同AI模型和应用场景自动搜索定制化安全护栏,而非套用统一方案。在四个测试集上验证,攻击成功率大幅下降且不影响正常任务完成率,同一防御方案在不同模型场景下效果差异显著。
西湖大学团队提出World in World,一种无需训练的接口,让冻结的视频世界模型通过原生注意力机制读取多种视觉证据,实现对已录制视频的自由视角探索和事件同步重渲染,性能超越现有方法。
SAP CEO Christian Klein 在 Big Technology Podcast 中坦言,企业 AI 落地的核心障碍不是技术能力,而是精度信任与数据治理——财务关账等任务需要 100% 准确率,而非 90...
OpenAI DevDay发布了一批重磅更新:GPT-6.1 Soul将Computer Use成本降至原来的七分之一、速度提升7倍;Dots让每个Agent拥有独立的云端Linux虚拟机;Decisions API带来...
a16z增长团队拆解最新"市场状态"报告,逐一解析AI基础设施建设热潮背后的数据逻辑:从超大规模厂商合计7800亿美元的资本支出,到AI建设规模首次超越铁路时代的历史坐标,再到企业AI落地2%的追踪率与69%部署率之间的...
AgentGrad是一个多智能体提示词优化框架,通过序贯干预精确定位失败智能体并生成细粒度监督信号,结合语义梯度聚类抽象出通用纠正模式,在五个基准上超越现有方法,同时优化速度提升2.5倍。
本文解读了一种无创脑机接口语音解码方法Brain2Semantics2Text,通过将MEG脑磁图信号映射到预训练语义向量空间再反演为文字,绕开逐词对齐难题,在句子级语义相似度上超越现有非侵入式方法,为瘫痪患者语言辅助设...
研究团队构建了首个针对随机过程领域的Lean 4形式化数学基准STOCHBENCH,包含450道研究生级题目,测试显示AI证明器在需要独立构造证明的抽象型题目上明显吃力。
本文解读2014年Simonyan与Zisserman提出的双流卷积网络,讲述深度学习如何首次在视频动作识别任务上超越手工特征方法,准确率达到88%,并追溯其对后续I3D等研究的深远影响。
美国时间昨天下午,一份叫"White House Accord on Super Intelligence"的一页纸自律协议被签署,同时美国联邦机构把AI改称"超级智能"(SI)。这件事占据了当天大部分科技新闻的头条。
9月28日,超级智算(北京)电子制造有限公司(以下简称"超级智算"或"APEX AI")与软通动力信息技术(集团)股份有限公司(以下简称"软通动力")正式签署战略合作协议。
随着算力集群不断扩大,半导体行业的需求也开始从先进制程和高端封装,延伸到成熟工艺和特色工艺。在这一轮需求变化中,以特色工艺为核心的格罗方德(GlobalFoundries),正在其中扮演重要角色。