当下,分布式存储应用非常广泛,主要用于Openstack私有云、各种共有云平台、以及服务器虚拟化、超融合等;按接口划分:分布式存储包含块存储、对象存储、文件存储等。分布式存储正逐渐取代传统磁盘阵列,成为现代存储平台建设的首选。
主流布式存储厂家以开源Ceph为基础或参考模型,以三副本架构为主,而道熵则采用双重RAID架构,每个节点采用存储虚拟化与本地RAID管理,节点间则是分布式两副本技术,架构上更接近(分布式)磁盘阵列。
三副本分布式存储采用网络间三副本策略实现数据保护与故障修复。当某个硬盘(OSD)发生故障时,该硬盘OSD上的数据将自动按CRUSH规则在其他硬盘OSD上重建。
三副本网络数据重建有以下几个弊端:1 、消耗网络带宽,可能会影响到业务数据的正常工作;2 、TCP/IP网络具有数据包丢失与重发的特性,可能导致网络故障或网络抖动,影响OSD的状态,引起OSD重建的连锁反应;3、严重时可导致业务中断、甚至丢失数据的风险。
三副本分布式存储的另一个弊端就是“慢盘”效应,以及相关的性能及稳定性问题。在三副本系统中,每个机械磁盘(HDD)单独作为一个OSD存储单元承接用户工作负载,而单个HDD随机IO读写非常低,仅为120 次读写/秒,极容易成为瓶颈。由于分布式存储采用随机数据分布,而随机性必然导致个别磁盘上的负载远超平均值(著名的正太分布效应);此外,磁盘本身的制造缺陷或故障还会加剧 “慢盘”现象发生的频率。当系统出现一个或多个慢盘时,不仅会拖累总体性能与用户体验,甚至可能导致业务卡顿、中断、甚至系统崩溃的严重事故。
双重RAID采用节点内RAID与网络两副本策略相结合的方式,实现数据保护与故障修复。各节点采用log-structured 软件定义 技术(而不是硬件RAID卡),实现节点存储资源池化、数据冗余保护(本地RAID)、ARC智能缓存、在线数据压缩、故障自动检测与报警等高级管理功能,通过虚拟卷为OSD提供存储服务(vOSD);在vOSD上层通过分布式两副本策略提供跨节点间数据保护与业务高可用功能。当某个硬盘发生故障时,由节点内RAID对数据实现本地数据修复,而上层vOSD状态正常,毫无感知,不会触发网络数据修复。与网络数据修复相比,本地RAID数据修复具有以下特征:1 硬件故障隔离,避免了网络修复可能导致的稳定性问题;2 可自动避让业务,保证业务无感知;3 本地修复时数据延迟小,不消耗网络带宽;4 抵御故障能力强,每个节点都能抵御一个或多个硬盘故障;而三副本最多抵御两个连续的硬盘故障。
双重RAID是迄今为止对付“慢盘”效应最有效的办法。在双重RAID架构中,每个节点不仅具备抵御磁盘故障、数据本地修复的能力,同时,通过存储资源池化技术将该节点上所有的vOSD 的工作负载平均分布到各个磁盘上。这种负载均衡技术可大幅度降低因工作负载不均匀,或个别磁盘性能下降导致的慢盘现象。此外,每个存储节点在整合的存储资源池基础上,利用节点的内存和大容量NVMe固态硬盘构成一个统一的两级缓存加速层,并采用自适应算法匹配vOSD工作负载的变化,大幅度提升各个vOSD承受极端工作负载的能力。
双重RAID的另一个技术优势在于,支持在线增加NVMe固态硬盘个数,或在线替换更大容量的NVMe固态硬盘,从而使得用户活动工作负载数据集 (Working Data Set),俗称热数据,可几乎全部落在两级缓存加速层中,从而使得系统总体性能可逼近全闪存存储系统。
总结:双重RAID架构与三副本架构相比,在性能、稳定性和数据可靠性方面具有明显优势。特别需要指出的是,双重RAID具备非常优秀的硬件故障隔离特性,而三副本对硬件故障的检查和容错能力较弱,因此双重RAID可显著降低运维难度与运维人工成本。
好文章,需要你的鼓励
这项研究提出了ORV(占用中心机器人视频生成)框架,利用4D语义占用作为中间表示来生成高质量的机器人操作视频。与传统方法相比,ORV能提供更精确的语义和几何指导,实现更高的时间一致性和控制精度。该框架还支持多视角视频生成(ORV-MV)和模拟到真实的转换(ORV-S2R),有效弥合了虚拟与现实之间的差距。实验结果表明,ORV在多个数据集上的表现始终优于现有方法,为机器人学习和模拟提供了强大工具。
这项研究由Writer公司团队开发的"反思、重试、奖励"机制,通过强化学习教导大型语言模型生成更有效的自我反思内容。当模型回答错误时,它会生成反思并二次尝试,若成功则奖励反思过程。实验表明,该方法在函数调用和数学方程解题上带来显著提升,最高分别改善18.1%和34.7%。令人惊讶的是,经训练的小模型甚至超越了同家族10倍大的模型,且几乎不存在灾难性遗忘问题。这种自我改进技术为资源受限环境下的AI应用开辟了新方向。
FuseLIP是一项突破性研究,提出了通过早期融合离散标记实现多模态嵌入的新方法。与传统CLIP模型使用独立编码器不同,FuseLIP采用单一编码器同时处理图像和文本标记,实现了更自然的模态交互。研究证明,这种早期融合方法在多种多模态任务上表现优异,特别是在需要理解图像结构而非仅语义内容的任务上。研究还开发了创新的数据集和评估任务,为多模态嵌入研究提供了宝贵资源。
ByteDance与浙江大学合作开发的MERIT是首个专为多语言多条件语义检索设计的基准数据集,包含320,000条跨5种语言的查询和135,000个产品。研究发现现有模型在处理多条件查询时过度关注全局语义而忽略特定条件元素,为此提出CORAL框架,通过嵌入重建和对比学习相结合的方式,使检索性能提升45.9%。这项研究不仅识别了现有方法的关键局限性,还为多条件交错语义检索领域的未来研究奠定了基础。