浪潮天梭M13 RAS设计之IMS内存检测隔离技术

浪潮天梭M13服务器是专为超大规模实时事务处理而设计的大型关键计算系统，面向总部级别的银行存储款、电信行业计费系统、跨国企业ERP等关键应用场景。

浪潮天梭M13服务器是专为超大规模实时事务处理而设计的大型关键计算系统，面向总部级别的银行存储款、电信行业计费系统、跨国企业ERP等关键应用场景。M13支持处理器核心数量超过1000个，具有强大的在线事务处理能力，同时采用了复杂的高可用技术系统，满足业务7*24小时稳定运行需求。

天梭M13的内存高可用挑战

RAS特性（即服务器的可靠性Reliability、可用性Availability以及可服务性Serviceability）对于大型关键应用主机来说尤为关键，能够让主机容忍各类软硬件故障，可以显著延长系统平均无故障时间，保证客户业务持续稳定运行，是保障系统高可用性的技术基础。

M13的可用性设计覆盖了系统的每个部分，极为复杂，本文只介绍一项内存可用性技术--IMS内存检测隔离。

内存错误和故障是引发系统硬件故障的原因之一，一方面，从SDR到DDR，再到目前的DDR3，内存的容量和性能不断提升，内存颗粒容量的增大、单元密度增加、生产工艺的复杂，客观上增加了内存缺陷检查和测试的难度；另一方面，天梭M13最大支持1536个DIMM插槽，内存容量高达48TB，使得内存发生错误和故障的概率显著增加。

IMS-Intelligent Memory Surveillance

目前，内存错误的诊断和处理技术相对成熟，主要有ECC、chipkill、SDDC等，这些技术能够检验内存错误，进行相应处理，但是有一定局限性，例如ECC可以检验和纠正一个数据位错误，但无法纠正2个错误位同时发生，而且如果ECC错误频繁发生会导致Multi-bit被标识为不可用，甚至触发MRC内存管理机制，将整个Rank/DIMM做disable处理。频繁的内存错误并不表示内存物理失效，也有可能是外部环境温度过高、电压波动等因素导致，这样的处理会减少内存性能、浪费内存空间，从而降低系统性能。

IMS-Intelligent Memory Surveillance，是一套完整的内存错误和故障校验、诊断和处理方法，具备内存检测、失效隔离和预警等完整的内存管理功能，解决了内存故障无法修复导致停机、故障难于定位、个别错误导致大规模内存浪费等内存错误和故障处理难题。

浪潮天梭M13服务器 RAS设计之IMS内存检测隔离技术

IMS技术原理图

IMS系统概述

浪潮天梭M13高端服务器的IMS系统配置了高效的内存诊断工具，用户可以自行对内存问题进行检查。M13开机时，在BIOS启动阶段（进入操作系统前），用户可进入Diagnostic模块，在 3 种不同强度的测试模式--Quick、Standard和Extensive中进行选择，对内存进行测试和检验。检测完成后，对于关键区域或大块面积的不可修复错误，IMS会给出警示信息，提示用户需要更换内存，对于非关键区域、分散性的少量错误，IMS会将错误地址记录并对故障单元进行隔离，机器之后的运行时不会再对这些错误地址进行访问。

当系统启动成功，进入OS后，IMS会实时进行内存的监测、保护和处理。首先IMS系统会实时统计内存 ECC 错误信息，并对错误地址以IMS自带的多个测试算法进行强化测试，对错误进行有效性确认，同时预测相关可能出错的地址。最后，IMS系统对确认错误或预测产生的不可纠错的内存，应用 OS 的隔离技术，在此部分内存区域空闲时予以隔离，离开应用内存空间。

IMS--内存错误减少95%以上

IMS系统能够在天梭M13服务器运行过程中，有效减少失效内存进入系统的机会。开机前的可选Diagnostic功能类似工厂专用内存测试ATE，但又优于ATE，可以让用户方便的进行全面内存检查。随着服役时间的延长，内存的电气性能会不断衰减，从而产生内存失效隐患，Diagnostic功能让用户有效避免这一隐患。

在系统运行时，IMS可以将故障内存进行隔离，也很好的防止内存退化带来的内存错误，提高系统可靠性。而且IMS对于内存错误的定位和处理更为精细和及时，某些本应作RMA处理的内存，可以在现场进行处理修复，大幅减少内存空间浪费行为。

如下图所示，在使用IMS后，ECC log报错日志内容随时间推移成收敛状态，效果显著，每小时ECC报错数从400次逐步减少到不足10次。数据表明，IMS可以有效减少内存错误的发生，提高内存可用性。

从天梭K1到天梭M13，浪潮关键应用主机在系统性能、可用性等方面都有了显著的提高。浪潮在RAS高可用等关键核心技术上的持续突破，有效提升了其关键应用主机系统的可靠性及产品品质，为金融、电信等关键行业的核心信息化应用提供了强有力的基础设施保障。

来源：业界供稿

0赞

好文章，需要你的鼓励

浪潮天梭M13 RAS设计之IMS内存检测隔离技术

来源：业界供稿

2018

01/22

11:29

分享

点赞

Google力推手机AI功能引发关注

Meta发布AI翻译功能，支持脸书和Instagram内容实时转换

HPE发布Nvidia Blackwell驱动的AI服务器，抢占AI市场需求

ISACA推出AI安全管理高级认证项目

谷歌推出智能体SOC系统提升安全事件响应速度

Lumen升级400GB数据中心连接基础设施助力AI发展

AI和流媒体推动，2030年面临"网络危机"

Pine64停产Pro手机转向RISC-V业务

日立Vantara将VSP One块存储扩展至Azure云平台

Finchetto光学数据包交换机：光无法存储的技术挑战与突破

Python开发者调查显示增长强劲，但基金会资金面临困境

多站点IT基础设施升级指南：告别VMware的替代方案

提速！浪潮网络“产品-方案-服务“能力全线升级

浪潮网络2024新品发布暨合作伙伴大会圆满落幕

浪潮KaiwuDB论文被数据库国际顶会ICDE2024录用

浪潮云海InCloud Sphere再次登顶SPECvirt全球第一

浪潮KaiwuDB魏可伟：AIoT，用行业定义数据库

加速数据价值兑现 浪潮海若大模型带来新动能

浪潮海若大模型业务战略正式发布

浪潮网络推出单芯片CLOS架构方案 打造极致简约的网络互联体验

落地南京！浪潮信息携手多伦科技打造，这款智慧路口可以“千城千面”！

浪潮KaiwuDB通过中国信通院“可信数据库”性能与稳定性评测

如果您非常迫切的想了解IT领域最新产品与技术信息，那么订阅至顶网技术邮件将是您的最佳途径之一

关于AI Agent落地，李开复强调了两件事：“价值交付”和“一把手工程”

AWS re:Inforce：费城这天不只拼进球，还拼生成式AI安全

在欧洲之门马德里，我们再次见证了SAP激活企业增长的“飞轮”

IEEE专家委员胡凝：消解AI幻觉“阴影”，洞见“超级个体”价值锚点

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点:

加速数据价值兑现浪潮海若大模型带来新动能

浪潮网络推出单芯片CLOS架构方案打造极致简约的网络互联体验