Карта событий при отказе производственной установки нужна не просто для фиксации того, что оборудование остановилось. Ее основная задача — показать, как установка перешла из нормального состояния в отказ, что происходило после отклонения и какие технические или организационные барьеры повлияли на результат. Поэтому начинать следует не с поиска виновного узла, а с установления исходного события, границ анализа и подтвержденной последовательности изменений.
Полезная карта отделяет факты от предположений. Время сигналов АСУ ТП, положение арматуры, срабатывание защит, показания приборов, команды оператора и состояние оборудования фиксируют как события, подтвержденные источниками. Предполагаемые причины и недостающие звенья отмечают отдельно. Иначе схема быстро превращается в удобную версию произошедшего вместо инструмента технического анализа.
- Что считать картой событий
- Сначала определите границы анализа
- Соберите исходные данные до формирования версии отказа
- Пошаговое построение карты событий
- 1. Зафиксируйте нормальное исходное состояние
- 2. Найдите инициирующее событие
- 3. Расположите подтвержденные события по времени
- 4. Добавьте защитные барьеры
- 5. Постройте альтернативные ветви
- 6. Определите конечные состояния
- Как оформлять каждое событие
- Не путайте последовательность с причинностью
- Что делать с противоречивыми и отсутствующими данными
- Нужны ли вероятности на карте
- Типичные ошибки при построении
- Начинать с очевидно поврежденного элемента
- Смешивать факты и объяснения
- Перегружать схему сигналами
- Игнорировать успешные действия защит
- Рассматривать человеческое действие вне технического контекста
- Останавливать анализ после нахождения первой причины
- Как проверить готовую карту
- Как превратить карту событий в план корректирующих действий
- Практический порядок работы после отказа
Что считать картой событий
В производственной практике под картой событий могут понимать несколько близких инструментов. Для разбора фактического отказа наиболее удобна схема, в которой совмещены временная последовательность, изменение состояния установки и реакции защитных функций. Если требуется оценить возможное развитие аварии после определенного инициирующего события, применяется логика дерева событий: от исходного события рассматриваются альтернативные ветви в зависимости от того, сработал или не сработал очередной барьер.
Важно отличать эту задачу от анализа причин отказа. Карта или дерево событий преимущественно отвечает на вопрос «что произошло или могло произойти дальше?». Дерево отказов движется в противоположном направлении: от нежелательного результата к техническим, человеческим и организационным причинам, которые могли его вызвать.
| Инструмент | Основной вопрос | Когда особенно полезен |
|---|---|---|
| Хронология событий | Что и в какой последовательности произошло? | При расследовании уже произошедшего отказа |
| Карта или дерево событий | Как исходное событие развивалось дальше и какие барьеры изменяли сценарий? | Для анализа развития отказа и возможных последствий |
| Дерево отказов | Какие причины и их сочетания могли привести к нежелательному состоянию? | Для поиска причин и анализа надежности |
| Анализ видов и последствий отказов | Какие отказы элементов возможны и к чему каждый из них приводит? | При систематической оценке оборудования или процесса до происшествия |
Эти методы не являются взаимоисключающими. При сложном происшествии сначала удобно восстановить фактическую хронологию, затем построить дерево развития сценария, а для критического узла при необходимости отдельно проанализировать причины его отказа.
Сначала определите границы анализа
Одна из распространенных ошибок — строить схему сразу после обнаружения неисправного агрегата. Например, если остановился насос, его отключение может быть не исходным событием, а следствием снижения уровня, блокировки, потери электропитания, закрытия арматуры или защитной команды системы управления.
До нанесения событий на схему необходимо зафиксировать четыре границы:
- объект анализа — вся технологическая установка, отдельная линия, аппарат, агрегат или функциональная система;
- начальное состояние — в каком режиме находилась установка до появления отклонения;
- конечное состояние — безопасный останов, потеря производительности, повреждение оборудования, разгерметизация или другой результат;
- временной интервал — период до первого заметного отклонения и достаточный отрезок после него, чтобы увидеть развитие ситуации.
Начало временного окна желательно переносить раньше первого аварийного сообщения. До сигнализации могли уже изменяться температура, давление, расход, вибрация, ток двигателя или положение регулирующего органа. Если анализ начинается непосредственно с аварийного сигнала, часть причинной цепочки можно потерять.
Соберите исходные данные до формирования версии отказа
Надежность карты напрямую зависит от качества исходной информации. Особенно опасно сначала сформулировать предполагаемую причину, а затем выбирать только подтверждающие ее события. Правильнее собрать доступные данные независимо от рабочей гипотезы и лишь после этого устанавливать связи.
Для производственной установки источниками могут быть:
- архив параметров АСУ ТП и технологические тренды;
- журнал событий и аварийных сообщений;
- история срабатывания блокировок и противоаварийной защиты;
- данные локальных контроллеров, приводов, частотных преобразователей и систем диагностики;
- журналы смены и оперативные записи;
- команды и действия персонала;
- сведения о переключениях электроснабжения;
- данные систем виброконтроля, состояния подшипников и других средств технического мониторинга;
- материалы осмотра оборудования после остановки;
- информация о предыдущем ремонте, техническом обслуживании или изменении конфигурации;
- фото- и видеоматериалы, если они относятся к рассматриваемому периоду.
Данные разных систем нельзя автоматически считать синхронизированными. Часы контроллера, сервера архивирования, операторской станции и автономного регистратора могут расходиться. Поэтому перед построением точной последовательности следует проверить временную привязку. Иногда разница даже в несколько секунд меняет вывод о том, было ли закрытие клапана причиной падения расхода или реакцией защиты на уже возникшее отклонение.
Пошаговое построение карты событий
1. Зафиксируйте нормальное исходное состояние
Опишите режим установки непосредственно перед нарушением: работающее оборудование, направление потоков, положение основных переключающих устройств, активные регуляторы, резервные агрегаты и значимые защитные функции. Здесь не нужен полный технологический регламент. Достаточно информации, без которой невозможно понять последующее изменение состояния.
Например, для насосной системы существенны работающий и резервный насос, наличие автоматического ввода резерва, положение входной и выходной арматуры, уровень в питающей емкости и доступность электропитания.
2. Найдите инициирующее событие
Инициирующее событие — это первое установленное событие, которое выводит рассматриваемую систему из исходного состояния и запускает анализируемую последовательность. Им не обязательно является окончательный отказ оборудования.
Инициатором могут оказаться потеря питания, прекращение подачи сырья, отказ регулирующего органа, разгерметизация, недопустимое изменение технологического параметра, ошибочная команда или другой фактор, после которого система начинает развиваться по новому сценарию.
Формулировка должна описывать событие, а не заранее назначенную причину. Запись «насос остановился по команде защиты» полезнее, чем «неисправная автоматика отключила исправный насос», пока неисправность автоматики не доказана.
3. Расположите подтвержденные события по времени
После выбора рабочей точки отсчета сформируйте последовательность наблюдаемых изменений. Для каждого элемента желательно указать время, источник информации, состояние до события и состояние после него.
Практический порядок может выглядеть так:
- Определить последнее подтвержденное нормальное состояние установки.
- Найти первое достоверное отклонение параметра или состояния оборудования.
- Добавить последующие технологические изменения.
- Вставить срабатывания сигнализации, блокировок и защит.
- Добавить автоматические команды исполнительным механизмам.
- Нанести действия оператора и ремонтного персонала.
- Зафиксировать фактическое конечное состояние установки.
- Отдельно отметить события, время или последовательность которых пока не подтверждены.
При большом количестве сигналов не нужно переносить в рабочую карту весь журнал АСУ ТП. Следует оставлять события, которые меняли состояние процесса, отражали важное изменение или позволяют установить причинно-временную связь. Тысячи вторичных сообщений могут скрыть несколько действительно значимых переходов.
4. Добавьте защитные барьеры
После восстановления основной последовательности следует проверить, какие предусмотренные барьеры должны были остановить развитие отказа или уменьшить его последствия.
К ним могут относиться автоматическое регулирование, предупредительная сигнализация, блокировки, аварийный останов, резервирование, обратные клапаны, отсечная арматура, предохранительные устройства, действия оператора и другие предусмотренные проектом меры.
Для каждого барьера полезно задать четыре вопроса:
- должен ли он был активироваться при фактических условиях;
- получил ли он необходимые входные сигналы;
- сформировал ли требуемую команду;
- выполнил ли исполнительный элемент эту команду и был ли достигнут ожидаемый технологический результат.
Такое разделение принципиально. Фраза «защита не сработала» слишком неопределенна. Датчик мог не обнаружить опасное состояние, контроллер мог не сформировать команду, исполнительный механизм мог не переместиться либо механизм мог сработать правильно, но его проектной эффективности оказалось недостаточно для конкретного сценария. Это разные проблемы и разные направления дальнейшего анализа.
5. Постройте альтернативные ветви
Если задача выходит за рамки реконструкции факта и требуется понять возможное развитие отказа, на каждой значимой защитной функции добавляют альтернативы. Обычно рассматривают успешное и неуспешное выполнение требуемой функции.
Условный пример: произошло падение давления смазки. Первый барьер — обнаружение недопустимого давления. Второй — автоматическое отключение агрегата. Третий — прекращение опасного движения после команды. Успешное прохождение этих функций может привести к контролируемому останову. Последовательный отказ нескольких барьеров способен вывести сценарий к повреждению оборудования.
Ветвление следует выполнять только там, где альтернативный результат действительно меняет дальнейшее развитие. Если два состояния приводят к одинаковой последовательности и одинаковым последствиям, искусственное разделение лишь усложняет карту.
6. Определите конечные состояния
Каждая ветвь должна завершаться понятным результатом. Нечеткая формулировка «авария» недостаточна, поскольку не показывает тяжесть и характер последствий.
В зависимости от установки конечными состояниями могут быть безопасный автоматический останов, управляемый останов оператором, кратковременная потеря производительности, длительный простой, повреждение агрегата, потеря герметичности или развитие другого опасного состояния.
На этом этапе особенно важно не смешивать сам отказ с его последствиями. Остановка привода является состоянием оборудования, а прекращение технологического потока или повреждение продукта может быть последствием этой остановки.
Как оформлять каждое событие
Единый формат записей значительно упрощает проверку карты. Название события должно показывать изменение состояния, а не содержать длинное объяснение предполагаемой причины.
| Поле | Что фиксировать |
|---|---|
| Событие | Краткое наблюдаемое изменение состояния |
| Время | Метка времени и при необходимости точность ее определения |
| Объект | Аппарат, привод, клапан, датчик, система управления или другое звено |
| Источник | Архив, журнал, осмотр, запись персонала или другой источник данных |
| Статус | Подтвержденный факт, расчетное событие или рабочая гипотеза |
| Результат | Как изменилось состояние процесса или оборудования |
Например, запись «10:14:22 — закрыт клапан подачи» недостаточна, если неясно, отражает ли она команду контроллера, сигнал конечного выключателя или фактическое положение, подтвержденное другим измерением. Чем критичнее событие для вывода о причине, тем важнее установить, что именно зарегистрировал источник.
Не путайте последовательность с причинностью
То, что событие произошло раньше другого, еще не означает, что первое вызвало второе. После первичного нарушения система управления способна почти одновременно генерировать несколько сигналов, а технологические параметры обладают собственной динамикой и инерцией.
Причинную связь желательно проверять минимум по трем признакам: первое событие действительно предшествует второму, между ними существует технически объяснимый механизм влияния, а наблюдаемые параметры согласуются с предполагаемым развитием.
Если связь пока основана только на временной близости, ее лучше обозначить как гипотезу. Это позволяет сохранить альтернативные версии и не блокировать дальнейшее расследование.
Что делать с противоречивыми и отсутствующими данными
Пробел в архиве не следует заполнять предполагаемым событием как установленным фактом. На карте можно явно оставить неизвестный переход: состояние до него известно, состояние после него известно, а механизм перехода требует проверки.
При противоречии источников необходимо оценить, что именно каждый из них измеряет. Например, команда на открытие клапана, дискретный сигнал «открыт» и реальный расход через трубопровод описывают разные уровни процесса. Они не обязаны изменяться одновременно и сами по себе не взаимозаменяемы.
Для критического участка полезно выстроить независимую проверку:
- сопоставить сигнал управления и обратную связь;
- проверить технологический параметр, который должен измениться после действия;
- сравнить информацию нескольких регистраторов;
- осмотреть физическое состояние узла после остановки;
- проверить, не выполнялись ли ранее ремонт или изменение настроек, способные повлиять на рассматриваемую функцию.
Если подтвердить переход невозможно, это само по себе значимый результат анализа: недостаточность регистрации событий может препятствовать достоверному расследованию и стать основанием для улучшения системы диагностики.
Нужны ли вероятности на карте
Для реконструкции уже произошедшего отказа вероятностный расчет обычно не является первым этапом. Сначала требуется достоверно установить последовательность и состояния барьеров.
Вероятности становятся полезны, когда дерево событий применяется для оценки риска будущих сценариев. Тогда каждой ветви могут соответствовать условные вероятности успешного или неуспешного выполнения функции, а сочетание ветвей используется для оценки вероятности конечных состояний.
Но такие значения нельзя назначать экспертно только ради заполнения схемы. Исходные данные должны соответствовать конкретному оборудованию, режимам, диагностическому покрытию, условиям эксплуатации и принятой методике оценки риска. Зависимые события также нельзя механически считать независимыми. Например, два защитных канала могут одновременно потерять работоспособность из-за общего электропитания или общего входного сигнала.
Типичные ошибки при построении
Начинать с очевидно поврежденного элемента
Поврежденный узел не обязательно был источником происшествия. Он мог оказаться первым элементом, на котором проявились последствия отклонения. Поэтому карта должна начинаться раньше физически обнаруженного повреждения.
Смешивать факты и объяснения
Запись «клапан не открылся из-за неисправного привода» содержит одновременно событие и вывод о причине. Сначала следует установить факт отсутствия требуемого перемещения, а состояние привода проверить отдельно.
Перегружать схему сигналами
Большое число однотипных сообщений не делает анализ точнее. На основной карте желательно оставить ключевые переходы, а полный журнал использовать как подтверждающий материал.
Игнорировать успешные действия защит
Для расследования важны не только отказавшие элементы. Успешно сработавший барьер показывает, где развитие сценария было ограничено и почему последствия не оказались тяжелее.
Рассматривать человеческое действие вне технического контекста
Если оператор выполнил неправильное действие или не выполнил требуемое, необходимо проверить доступную ему информацию, сигнализацию, время на реакцию, состояние интерфейса, действующие инструкции и автоматические функции. Простая отметка «ошибка оператора» редко объясняет механизм возникновения события.
Останавливать анализ после нахождения первой причины
Даже установленная неисправность конкретного элемента не отвечает на вопрос, почему единичный отказ смог привести к серьезному нарушению. Следует проверить резервирование, диагностику, защиту и возможность безопасной локализации отказа.
Как проверить готовую карту
Хорошая карта должна быть понятна специалисту, который не участвовал в ее составлении. Для проверки удобно пройти схему от начала до конца и убедиться, что каждый переход имеет физический или логический смысл.
Перед завершением анализа проверьте:
- определено ли последнее нормальное состояние;
- обоснованно ли выбрано инициирующее событие;
- разделены ли команды, сигналы обратной связи и фактические технологические результаты;
- проверена ли синхронизация времени разных источников;
- отмечены ли неизвестные и предположительные события;
- показаны ли предусмотренные защитные барьеры;
- понятно ли, какие барьеры сработали, а какие не выполнили требуемую функцию;
- рассмотрены ли общие причины нескольких отказов;
- определены ли конечные состояния всех значимых ветвей;
- подтверждаются ли выводы исходными данными, а не только последовательностью сигналов.
Еще одна полезная проверка — мысленно удалить предполагаемую первопричину из объяснения и посмотреть, остается ли карта логичной. Если схема работает только при заранее принятой версии, а часть переходов приходится объяснять предположениями, расследование еще не завершено.
Как превратить карту событий в план корректирующих действий
Ценность схемы возникает тогда, когда по ней можно определить, где именно следует разорвать нежелательную последовательность. Не все мероприятия должны быть направлены на первоначально отказавший компонент.
Например, анализ может показать несколько уровней улучшения: предотвратить исходный отказ, обнаружить его раньше, обеспечить автоматическую локализацию, сохранить работоспособность резервного оборудования или дать оператору более однозначную информацию. Такой подход обычно надежнее попытки устранить только один дефект.
При выборе мероприятий стоит рассматривать:
- устранение подтвержденной технической причины;
- уменьшение зависимости от единичного элемента или общего источника отказа;
- улучшение диагностики и контроля фактического состояния исполнительных механизмов;
- пересмотр логики сигнализации и защит, если анализ выявил недостаток именно в ней;
- повышение полноты регистрации событий;
- уточнение действий персонала при конкретном отклонении;
- проверку аналогичных узлов и установок, если обнаруженный механизм отказа для них применим.
После изменения оборудования, алгоритма управления или эксплуатационной процедуры карту полезно пройти повторно. Нужно проверить не только устранение первоначального сценария, но и то, не появились ли новые зависимости или нежелательные ветви.
Практический порядок работы после отказа
Если производственная установка уже отказала, наиболее надежная последовательность действий выглядит так: сначала обеспечить предусмотренное безопасное состояние объекта и сохранить доступные записи, затем определить границы происшествия и собрать данные из независимых источников. После синхронизации времени следует восстановить фактическую хронологию, определить инициирующее событие, нанести реакции автоматики и персонала и только затем переходить к анализу причин.
Для сложной установки одной линейной хронологии обычно недостаточно. Добавление защитных барьеров и альтернативных ветвей показывает, почему конкретный отказ завершился именно наблюдаемым состоянием и где существовала возможность остановить его развитие. Наиболее полезный результат карты — не красивое графическое представление, а подтвержденная причинно-временная модель, по которой можно обосновать технические проверки и корректирующие мероприятия.
Если карта используется как часть официального расследования аварии, инцидента или анализа риска опасного производственного объекта, порядок оформления, состав исходных материалов, методику расчетов и действующие требования необходимо отдельно проверять для конкретного объекта и юрисдикции.
Материал предназначен для общего понимания метода. При отказах, способных привести к травмированию людей, пожару, взрыву, выбросу опасных веществ или повреждению критического оборудования, анализ и решения по дальнейшей эксплуатации должны выполнять компетентные специалисты с учетом проектной документации и действующих требований промышленной безопасности.