HACMP工作原理以及日常维护

　2008-11-11 08:15:02　来源：WEB开发网　　　

核心提示： a.硬盘故障一般我们都将硬盘设置成RAID-5方式或mirror方式，从而提供硬盘的高可用性，HACMP工作原理以及日常维护(3)，RAID-5将奇偶较验位分散在硬盘组中，因此当一组内的一个硬盘坏掉，可以结合AIX基本功能和HACMP提供的一些机制，如Error Notification

a.硬盘故障

一般我们都将硬盘设置成RAID-5方式或mirror方式，从而提供硬盘的高可用性。RAID-5将奇偶较验位分散在硬盘组中，因此当一组内的一个硬盘坏掉，组内的其他硬盘可以通过奇偶较验位将该硬盘上的数据恢复出来。RAID-5方式一般是由硬件实现的，如下7133的SSA适配器,而且如果同一组内的两个硬盘坏掉，该组硬盘的数据很可能就会全部丢失。mirror方式是将同一个数据写到至少两个物理外置上，因此它的效率没有RAID-5好，而且用盘量大，但安全性比RAID-5高，而且它易于实现，通过AIX中的(Logic Volume Management)可以很方便地设置。

b.硬盘控制卡

存储设备连接到主机上都必须通过一块控制卡，SCSI设备是SCSI Adapter, SSA设备是SSA Adapter,如果这块卡坏掉，与之连接的外设就无法利用。有几种办法可以解决这个问题。

一种办法是用多个adapter。每个主机上都有两块或两块以上adapter,分别连接mirror的数据，因此无论是硬盘坏掉，还是Adapter坏掉，所有好数据还是可以被主机利用，不会出现单点故障。这种方法实现起来并不难，但必须配置多块adapter,而且必须采用数据mirror方式。这种方法也不用通过HACMP来实现。

另一种方法仍只用一块adapter,利用HACMP中的Error Notification Facility( 错误通告机制)来解决。

Error Notification Facility是HACMP提供的对其他设备的监控工具，任何报告给AIX的错误(error)都能被捕获被采取相应措施。HACMP提供了smit界面，使配置简单化。

我们已知道，用LVM可实现硬盘镜像，当一个盘坏掉，仍有一份数据在镜像盘里，数据仍可进行读写，但此时数据不再有可用性，若镜像盘也坏掉则数据全部丢失。所以在此例中，PV丢失(LVM_PVMISS)的信息会大幅显示在控制台面上，从而提醒用户去仔细查看error log找出故障并修复它。同样，此例中HACMP提供了界面，结合AIX的功能，从而监控故障的发生。

c.应用故障

如果用户的应用有kernel call调用，或以root身份来启动等，一旦应用发生故障，很容易导致操作系统down掉，发生死机，这时实际上等于节点故障，HACMP会采取相应接管措施。如果只是应用自身死掉，AIX仍正常运行，HACMP最多利用Error Notification Facility来提供监控功能，对应用本身不采取任何动作。但如果应用中调用了AIX的SRC (System Resource Controller)机制所提供的API接口，就可以使应用在down掉后自动重新启动。除了SRC提供API接口外，HACMP中的clinfo也提供这样的API。

clinfo是cluster Information daemon,它负责维护整个cluster的状态的信息，clinfo API允许应用程序利用这些状态信息来采取相应行动。

d. HACMP故障

如果cluster中节点的HACMP进程down掉，HACMP将其升级为节点故障，从而发生资源接管。

如上所述，HACMP只全权负责诊断网卡故障、网络故障和节点故障这三类故障，并负责实现IP地址转换或接管，以及整个系统资源( 硬件、文件、系统、应用程序，等等)的接管。对于这三类故障外的其他故障，可以结合AIX基本功能和HACMP提供的一些机制，如Error Notification Facility, clinfo API 等，同样可以实现对故障的监控并采取相应措施。

上一页 1 2 3