サーバーからディスクを取り外した後、LinuxソフトウェアRAIDが応答しなくなります

Question

CentOS 7マシン（標準カーネル：3.10.0-327.36.3.el7.x86_64）を16x1上のソフトウェアRAID-10で実行していますTB SSD（より正確には、2つのRAIDアレイがあります）ディスク;アレイの1つがホストのスワップパーティションを提供しています）先週、SSDに障害が発生しました：

13:18:07 kvm7 kernel: sd 1:0:2:0: attempting task abort! scmd(ffff887e57b916c0) 13:18:07 kvm7 kernel: sd 1:0:2:0: [sdk] CDB: Write(10) 2a 08 02 55 20 08 00 00 01 00 13:18:07 kvm7 kernel: scsi target1:0:2: handle(0x000b), sas_address(0x4433221102000000), phy(2) 13:18:07 kvm7 kernel: scsi target1:0:2: Enclosure_logical_id(0x500304801c14a001), slot(2) 13:18:10 kvm7 kernel: sd 1:0:2:0: task abort: SUCCESS scmd(ffff887e57b916c0) 13:18:11 kvm7 kernel: sd 1:0:2:0: [sdk] FAILED Result: hostbyte=DID_OK driverbyte=DRIVER_SENSE 13:18:11 kvm7 kernel: sd 1:0:2:0: [sdk] Sense Key : Not Ready [current] 13:18:11 kvm7 kernel: sd 1:0:2:0: [sdk] Add. Sense: Logical unit not ready, cause not reportable 13:18:11 kvm7 kernel: sd 1:0:2:0: [sdk] CDB: Write(10) 2a 08 02 55 20 08 00 00 01 00 13:18:11 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 39133192 13:18:11 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 39133192 13:18:11 kvm7 kernel: md: super_written gets error=-5, uptodate=0 13:18:11 kvm7 kernel: md/raid10:md3: Disk failure on sdk3, disabling device.#012md/raid10:md3: Operation continuing on 15 devices. 13:19:27 kvm7 kernel: sd 1:0:2:0: device_blocked, handle(0x000b) 13:19:29 kvm7 kernel: sd 1:0:2:0: [sdk] Synchronizing SCSI cache 13:19:29 kvm7 kernel: md: md3 still in use. 13:19:29 kvm7 kernel: sd 1:0:2:0: [sdk] Synchronize Cache(10) failed: Result: hostbyte=DID_NO_CONNECT driverbyte=DRIVER_OK 13:19:29 kvm7 kernel: mpt3sas1: removing handle(0x000b), sas_addr(0x4433221102000000) 13:19:29 kvm7 kernel: md: md2 still in use. 13:19:29 kvm7 kernel: md/raid10:md2: Disk failure on sdk2, disabling device.#012md/raid10:md2: Operation continuing on 15 devices. 13:19:29 kvm7 kernel: md: unbind<sdk3> 13:19:29 kvm7 kernel: md: export_rdev(sdk3) 13:19:29 kvm7 kernel: md: unbind<sdk2> 13:19:29 kvm7 kernel: md: export_rdev(sdk2)

/proc/mdstatは期待どおりに見え（1つの障害のあるメンバー）、VMは問題なく実行を続けました。

md3 : active raid10 sdp3[15] sdb3[2] sdg3[12] sde3[8] sdn3[11] sdl3[7] sdm3[9] sdf3[10] sdi3[1] sdk3[5](F) sdc3[4] sdd3[6] sdh3[14] sdo3[13] sda3[0] sdj3[3] 7844052992 blocks super 1.2 128K chunks 2 near-copies [16/15] [UUUUU_UUUUUUUUUU]

1 TB SSDが利用できなかったため、SSDを一時的に大きなSSDに交換する必要がありました。それで、再構築を開始し、すべてが正常でした。今日、「正しい」SSDが到着したので、データセンターの技術者が前述のSSDを含むトレイを引っ張ったところ、システムが数秒以内に応答しなくなりました。ホストが分離されたRAIDアレイで正常に実行されている間、VMはI/Oを実行できませんでした。負荷は800を超えました。劣化した（ただしアクティブ/クリーンな）アレイを示したmdadm --detail /dev/md3を実行するため、この観点からはシステムは完全に問題ありませんでした。アレイから障害のある/欠落しているドライブを削除しようとしましたが、もちろん失敗しました（ "そのようなデバイスはありません」）、そして突然mdadm --detail /dev/md3でさえ出力を生成しなくなり、単にスタックし、これから抜け出すためにSSHセッションを強制終了する必要がありました。その後、私は再起動を強制することにしました。この障害のあるドライブをアレイから削除する方法すら知りませんでした-そしてすべてが正しく起動しました。もちろん、RAIDはまだ度数でした急いで再同期が必要でしたが、それ以外は：問題ありません。

トレイをラックから引き出す前に、--set-faultyの後にmdadmを介してドライブを should 削除したと確信しています mdraidのこの動作を説明することはできませんが。私の意見では、定期的なディスクの停止を「シミュレート」したので、この問題の原因とその確認方法を誰かが知っています。次の定期的なディスク停止は同じ問題を引き起こしませんか？

カーネルはいくつかのメッセージをログに記録しました。興味深いのは、プルされたデバイスがsdkとして知られているのに対し、新しいデバイスは sdq として起動したことです。したがって、sdkが配列から正しくキックされなかったと思います。先週最初のSSD障害が発生したとき、私はこの動作を見ませんでした。そのため、交換用ドライブもsdkとして表示されました。

ログには、古いSSDが故障してから新しいSSDが挿入されるまでの7分も示されているため、 https://superuser.com/questions/942886/）で説明されているような問題はないと思います。 fail-device-in-md-raid-when-ata-stops-responding が発生しました。また、VMは7分後ではなく、すぐにダウンしました。それで-それについて何か考えはありますか？大歓迎です:)

11:45:36 kvm7 kernel: sd 1:0:8:0: device_blocked, handle(0x000b) 11:45:37 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 0 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069640 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069648 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069656 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069664 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069672 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069680 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069688 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069696 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069704 11:45:37 kvm7 kernel: md/raid10:md3: sdk3: rescheduling sector 4072069712 11:45:37 kvm7 kernel: sd 1:0:8:0: [sdk] FAILED Result: hostbyte=DID_NO_CONNECT driverbyte=DRIVER_OK 11:45:37 kvm7 kernel: sd 1:0:8:0: [sdk] CDB: Read(10) 28 00 20 af f7 08 00 00 08 00 11:45:37 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 548402952 11:45:37 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 0 11:45:37 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 39133192 11:45:37 kvm7 kernel: md: super_written gets error=-5, uptodate=0 11:45:37 kvm7 kernel: md/raid10:md3: Disk failure on sdk3, disabling device.#012md/raid10:md3: Operation continuing on 15 devices. 11:45:37 kvm7 kernel: md: md2 still in use. 11:45:37 kvm7 kernel: md/raid10:md2: Disk failure on sdk2, disabling device.#012md/raid10:md2: Operation continuing on 15 devices. 11:45:37 kvm7 kernel: blk_update_request: I/O error, dev sdk, sector 39133264 11:45:37 kvm7 kernel: md: super_written gets error=-5, uptodate=0 11:45:37 kvm7 kernel: sd 1:0:8:0: [sdk] Synchronizing SCSI cache 11:45:37 kvm7 kernel: sd 1:0:8:0: [sdk] Synchronize Cache(10) failed: Result: hostbyte=DID_NO_CONNECT driverbyte=DRIVER_OK 11:45:37 kvm7 kernel: mpt3sas1: removing handle(0x000b), sas_addr(0x4433221102000000) 11:45:37 kvm7 kernel: md: unbind<sdk2> 11:45:37 kvm7 kernel: md: export_rdev(sdk2) 11:48:00 kvm7 kernel: INFO: task md3_raid10:1293 blocked for more than 120 seconds. 11:48:00 kvm7 kernel: "echo 0 > /proc/sys/kernel/hung_task_timeout_secs" disables this message. 11:48:00 kvm7 kernel: md3_raid10 D ffff883f26e55c00 0 1293 2 0x00000000 11:48:00 kvm7 kernel: ffff887f24bd7c58 0000000000000046 ffff887f212eb980 ffff887f24bd7fd8 11:48:00 kvm7 kernel: ffff887f24bd7fd8 ffff887f24bd7fd8 ffff887f212eb980 ffff887f23514400 11:48:00 kvm7 kernel: ffff887f235144dc 0000000000000001 ffff887f23514500 ffff8807fa4c4300 11:48:00 kvm7 kernel: Call Trace: 11:48:00 kvm7 kernel: [<ffffffff8163bb39>] schedule+0x29/0x70 11:48:00 kvm7 kernel: [<ffffffffa0104ef7>] freeze_array+0xb7/0x180 [raid10] 11:48:00 kvm7 kernel: [<ffffffff810a6b80>] ? wake_up_atomic_t+0x30/0x30 11:48:00 kvm7 kernel: [<ffffffffa010880d>] handle_read_error+0x2bd/0x360 [raid10] 11:48:00 kvm7 kernel: [<ffffffff812c7412>] ? generic_make_request+0xe2/0x130 11:48:00 kvm7 kernel: [<ffffffffa0108a1d>] raid10d+0x16d/0x1440 [raid10] 11:48:00 kvm7 kernel: [<ffffffff814bb785>] md_thread+0x155/0x1a0 11:48:00 kvm7 kernel: [<ffffffff810a6b80>] ? wake_up_atomic_t+0x30/0x30 11:48:00 kvm7 kernel: [<ffffffff814bb630>] ? md_safemode_timeout+0x50/0x50 11:48:00 kvm7 kernel: [<ffffffff810a5b8f>] kthread+0xcf/0xe0 11:48:00 kvm7 kernel: [<ffffffff810a5ac0>] ? kthread_create_on_node+0x140/0x140 11:48:00 kvm7 kernel: [<ffffffff81646a98>] ret_from_fork+0x58/0x90 11:48:00 kvm7 kernel: [<ffffffff810a5ac0>] ? kthread_create_on_node+0x140/0x140 11:48:00 kvm7 kernel: INFO: task qemu-kvm:26929 blocked for more than 120 seconds. [serveral messages for stuck qemu-kvm processes] 11:52:42 kvm7 kernel: scsi 1:0:9:0: Direct-Access ATA Kingston SKC400S 001A PQ: 0 ANSI: 6 11:52:42 kvm7 kernel: scsi 1:0:9:0: SATA: handle(0x000b), sas_addr(0x4433221102000000), phy(2), device_name(0x4d6b497569a68ba2) 11:52:42 kvm7 kernel: scsi 1:0:9:0: SATA: Enclosure_logical_id(0x500304801c14a001), slot(2) 11:52:42 kvm7 kernel: scsi 1:0:9:0: atapi(n), ncq(y), asyn_notify(n), smart(y), fua(y), sw_preserve(y) 11:52:42 kvm7 kernel: scsi 1:0:9:0: qdepth(32), tagged(1), simple(0), ordered(0), scsi_level(7), cmd_que(1) 11:52:42 kvm7 kernel: sd 1:0:9:0: Attached scsi generic sg10 type 0 11:52:42 kvm7 kernel: sd 1:0:9:0: [sdq] 2000409264 512-byte logical blocks: (1.02 TB/953 GiB) 11:52:42 kvm7 kernel: sd 1:0:9:0: [sdq] Write Protect is off 11:52:42 kvm7 kernel: sd 1:0:9:0: [sdq] Write cache: enabled, read cache: enabled, supports DPO and FUA 11:52:42 kvm7 kernel: sdq: unknown partition table 11:52:42 kvm7 kernel: sd 1:0:9:0: [sdq] Attached SCSI disk

shodanshok · Accepted Answer

カーネルスタックトレースから、mdドライバーがアレイ（freeze_array+0xb7/0x180 [raid10]）をフリーズして、失敗したメンバーを完全に削除しようとしたようですが、この操作は完了しませんでした。これは、md: unbind<sdk3>行がないことで確認されます。

私には、デッド/ライブロックの問題のように思われるため、根本的な原因はソフトウェアのバグである可能性があります。あなたは本当に Linux RAIDメーリングリストでレポートを提出するべきです