OS ストールによる OS の再起動
Issue
- お客様に予期しない再起動の問題が発生しました。
- 調査の結果、その際にカーネルパニックが発生し、その原因が clusterpro ソフトウェアによるタイマー監視のタイムアウトであることが判明しました。 タイムアウトは、タイマー監視を実行する cluserpro 関連のプロセスがストールした場合に発生します。
- vmcore の分析によると、複数のプロセスが I/O を待機していました。 おそらく、clusterpro 関連のプロセスが動作しなくなり、タイマー監視のタイムアウトに達しました。 kjounald、pdflush などのシステムプロセスが I/O を待機していましたか?
- プロセスは、どの ST が 'UN' であるかをリストします。
PID PPID CPU TASK ST %MEM VSZ RSS COMM
645 83 1 ffff81023dcff7e0 UN 0.0 0 0 [kjournald]
3297 83 1 ffff8101b6c8c7a0 UN 0.0 0 0 [pdflush]
3426 83 1 ffff81008875e100 UN 0.0 0 0 [pdflush]
5083 1 0 ffff81023bbe3080 UN 0.0 5904 696 syslogd
6219 6218 1 ffff810232cbe0c0 UN 0.0 23824 1780 clpevent
16845 16840 0 ffff8100850987e0 UN 0.0 3844 616 sadc
29187 29183 1 ffff810110d3a0c0 UN 0.0 29696 4628 actlog_cpuload
^^
Environment
- Red Hat Enterprise Linux 5.5
- kernel-2.6.18-194.32.1.el5
- CFQ I/O スケジューラーと IOPRIO_CLASS_IDLE 優先度の使用
Subscriber exclusive content
A Red Hat subscription provides unlimited access to our knowledgebase, tools, and much more.