Skip to content

обработка простоев

обработка простоев

1. Обзор

1.1 Версия

Версия сервера FineBIФункциональные изменения
6.0-

1.2 Сценарии применения

После развертывания BI-проекта на сервере он будет простаивать по разным причинам. Если вы перезапустите сервер сразу после простоя без захвата DUMP-файла, будет сложно найти истинную причину, поэтому вы не сможете быстро решить проблему и предпринять некоторые профилактические меры, чтобы предотвратить повторение профилактических мер, что приведет к неоценимой потере времени и усилий, эксплуатация и обслуживание сервера будет очень недружелюбной.

FineBI предоставляет функцию "Обработка простоя". С помощью этой функции BI-проекты могут автоматически генерировать DUMP-файлы и одновременно перезагружать систему.

После простоя, проанализировав сгенерированный DUMP-файл, вы сможете быстро найти причину простоя, своевременно решить проблему простоя и принять эффективные профилактические меры, чтобы подстраховать пользователей.

1.3 Функциональный профиль

Функция "Обработка простоев" - это, по сути, автоматизированный инструмент обработки простоев с порталом платформы и порталом клиента.

(1) Сторона платформы: встроенная часть платформы предназначена в основном для мониторинга рабочей среды и некоторых настроек, соответственно, мастер самопомощи при простоях, мониторинг работы, обработка простоя, записи экспорта стека памяти, записи перезапуска сервера.

(2) Клиент: клиент в основном следит за состоянием работы проекта.

Примечание 1: Функция "Downtime Handling" не поддерживается для развертывания контейнеров не-Tomcat и проектов, поставляемых с конструктором.

Примечание 2: Когда пользователи интеграции отчетов и BI используют эту функцию, функция "Обработка простоя" проекта BI вызывается в приоритетном порядке, а функция "Обработка простоя" проекта отчета отключается, чтобы не повлиять на работу проекта BI.

2. сторона платформы

Супервизор входит в систему FineBI и нажимает "System Management > Интеллектуальная эксплуатация и обслуживание > Обработка простоев", после чего на стороне платформы появляется соответствующий функциональный блок. Как показано на рисунке ниже:

Функции модуля разделены на 5 частей: Мастер самопомощи при простое, Мониторинг работы, Обработка простоя, Запись экспорта стека памяти и Запись перезагрузки сервера.

Примечание: Когда страница обработки простоя открывается на стороне платформы, она долго загружается, поэтому, пожалуйста, будьте терпеливы.

2.1 Мастер самопомощи при простое

Запишите время и причины простоя проекта в отчете и предоставьте соответствующие рекомендуемые решения по обработке. Как показано на рисунке ниже:

Возможные причины простоя и рекомендуемые варианты лечения приведены в таблице ниже:

Причина простояРекомендуемая программа лечения
переполнение памяти* остановка двигателя* Расчет шаблонов с большим потреблением памяти* Шаблон расчетного часа* Слишком маленькое выделение памяти в куче* Количество строк в одном наборе данных превышает рекомендуемый предел* Количество ячеек в одном шаблоне превышает рекомендуемый лимит1) Устраните неполадки с шаблонами, включите и разумно настройте ограничения шаблонов 2) Используйте функцию health patrol для обнаружения и разумной настройки кучи памяти. Функцию патрулирования здоровья см. в разделе: Патрулирование здоровья. 3) Проверка шаблонов, включение и разумная настройка ограничений шаблонов
Ошибки JDKЗаменено на JDK8 версии 1.8.0_181 и выше
Память операционной системы настроена неправильноИспользуйте Health Patrol для обнаружения и рационального распределения системной памятиФункцию "Патруль здоровья" см. в разделе: Патруль здоровья
Недостаточно места на дискеПожалуйста, проверьте место на диске и очистите ненужные файлы.Расширение диска см. в разделе: Расширение диска
Количество файлов, отображаемых в памяти, слишком малоИспользуйте Health Patrol, чтобы определить конфигурацию подсчета файлов в памяти и изменить ее, используя рекомендуемые значения.Функцию "Патруль здоровья" см. в разделе: Патруль здоровья
Ошибки в сторонних движках, используемых в старых версиях графиковОбновите систему до последней версииИнформацию об инженерных обновлениях см. в разделе: Руководство по обновлениям
Файлы сбоя есть, но причину сбоя определить невозможноЗагрузка журналов облачных операций для получения обратной связиФункциональные возможности Cloud Ops см. в разделе: Шаги использования Cloud Ops
выход по sshЗамените команду запуска или используйте инструмент командной строки secureCRTО запуске проекта см. в разделе: Запуск FineBI в Linux.
Блокировка потоков из-за получения данныхИспользуйте функцию кэширования рисунка для повышения скорости выборки или используйте вспомогательную функцию шаблона для обнаруженияО функции кэширования рисунков смотрите: Введение в кэширование рисунков.Вспомогательные функции шаблонов см. в разделе: Помощник проверки шаблонов
Блокировка вывода журналаУвеличьте уровень журнала или проверьте, достаточно ли места осталось на диске.Настройку уровня журнала см. в разделе: Профиль журналаРасширение диска см. в разделе: Расширение диска
Системная память освобождается слишком долго1) Настройте память кучи на значение меньше 64 ГБМетоды настройки памяти кучи см. в разделе: Патрулирование здоровья2) Рекомендуется заменить процессор на более производительный.Рекомендации по аппаратному обеспечению см. в разделе: Рекомендации по конфигурации сервера FineBI

2.2 Эксплуатационные испытания

Если вы хотите использовать функцию обработки простоя, описанную в разделе 2.3, вы должны убедиться, что каждая из проверок выполнения выполнена.

Для корректной работы Downtime Automation Tool система должна удовлетворять некоторым условиям. Поэтому при запуске проекта сначала проверяется состояние порта, окружение JDK, наличие неиспользуемой памяти и развертывание.

Если возникнет проблема, он напомнит пользователю о необходимости внести соответствующие изменения или отключить функцию простоя, а если проблемы не возникнет, он продолжит стабильную работу. Как показано на рисунке ниже:

В следующей таблице показано содержание проверки для каждого пункта "Проверка работы":

Примечание: Если результат теста благоприятный, появится сообщение "Эта конфигурация хороша, настройка не требуется".

серийный номерконтрольный списокКритерии обнаружения проблемПредлагаемые изменения
1операционная системаТекущая система не Windows/LinuxДля стабильной работы Downtime Automation Tool рекомендуется использовать Linux.В этом состоянии не будут проводиться следующие четыре проверки
2портыНенормальное состояние порта 12100 (порт не открыт или занят)Для обеспечения нормальной работы системы рекомендуется открыть порт 12100 или настроить другие порты.Настройки портов см. в разделе 2.3.5.
3JDK1) В проекте установлен не Oracle jre tools.jar, а JDK не сконфигурирован в проекте (проблема с системной конфигурацией JDK).(2) В проекте отсутствует файл tools.jar, а JDK не сконфигурирован в проекте (проблема с системной конфигурацией JDK).Рекомендуется увеличить системный параметр JDK configuration/tools.jar, чтобы обеспечить правильную работу системы.Настройки JDK и tools.jar см. в разделе: Автономное развертывание Tomcat Server на Linux.
4память вне кучиЗакончилась память в кучеНастоятельно рекомендуется, чтобы общий объем памяти физической машины за вычетом памяти, используемой контейнером, в котором находится система, составлял не менее 10 ГБ.
5Метод развертыванияРазвертывание контейнеров, не относящихся к TomcatРекомендуется развертывание контейнера TomcatРазвертывание Tomcat см. в разделе: Развертывание сервера Tomcat

Когда мониторинг операционной системы, порта, JDK, или вне кучи памяти влияет на использование функции, пользователи будут напоминать об этом через "Сообщение платформы" и "Всплывающее сообщение" в правом нижнем углу платформы.

Нажмите "Обработать", чтобы перейти на страницу конфигурации платформы "Обработка простоя", чтобы обработать ее соответствующим образом. Как показано на рисунке ниже:

Напоминание о сообщении гласит: Некоторые конфигурации системы обнаружены как отсутствующие или необоснованные, и средство автоматической обработки простоя недоступно, чтобы обеспечить нормальную работу функции, мы рекомендуем вам своевременно решить эту проблему.

2.3 Обработка простоя

Если вы хотите использовать функцию обработки простоев, вы должны убедиться, что все пункты раздела 2.2 "Оперативное обнаружение" выполнены.

В разделе "Downtime Handling" пользователи могут выполнить некоторые настройки конфигурации, среди которых: автоматическая обработка простоя, автоматический экспорт стека памяти, автоматический перезапуск при простое, уведомление о простое, настройки порта. Как показано на рисунке ниже:

Чтобы все следующие настройки вступили в силу, необходимо нажать кнопку "Сохранить".

2.3.1 Автоматическая обработка времени простоя

Инструмент запускается автоматически, когда конфигурация системы соответствует условиям запуска в разделе "Мониторинг запуска", этот переключатель включен по умолчанию.

Если конфигурация системы не соответствует условиям эксплуатации, значок переключателя становится серым, и его нельзя редактировать и изменять.

  • В рабочее время (6:00-23:00), когда основной процесс проекта останавливается на 5 минут, инструмент автоматизации простоя закрывается вместе с ним.

  • В нерабочее время (0:00-6:00, 23:00-24:00) основной процесс проекта остановлен, и Downtime Automation Tool не следит за ним.

2.3.2 Автоматический экспорт стеков памяти

  • Если функция "Автоматическая обработка времени простоя" не включена, этот пункт будет выделен серым цветом и не может быть отредактирован.

  • Если включен параметр "Автоматическая обработка простоев", этот пункт по умолчанию выключен. При его включении журналы простоя будут экспортироваться автоматически при возникновении простоя.

Поддержка экспортируемых журналов простоя: стек, histo, dump

Экспортируется из папки %Tomcat%\logs\FineLog\ date на сервере, где находится вышедший из строя узел.

Примечание: журналы дампов экспортируются автоматически при включении. Если вы опасаетесь, что длительное время экспорта дампов повлияет на производительность, вы можете выбрать экспорт только стека и журналов histo.

2.3.3 Автоматический перезапуск при простое

  • Если функция "Автоматическая обработка времени простоя" не включена, этот пункт будет выделен серым цветом и не может быть отредактирован.

  • Есливключен параметр "Автоматическая обработка простоя", этот пункт по умолчанию отключен, и проект будет перезапускаться автоматически при возникновении простоя после его включения.

При включении переключателя определяется состояние инструмента и текущее состояние системы. Определяется, является ли это операционная система Windows или нет, и является ли это форма службы Windows или нет.

(1) Если система представляет собой операционную систему Windows и форму службы Windows, во всплывающем окне появится сообщение: Эта функция не поддерживает текущую систему. Как показано на рисунке ниже:

После нажатия кнопок OK и Close всплывающее окно закрывается, а выключатель не включается.

(2) Если система представляет собой операционную систему Windows и форму обслуживания, отличную от Windows, во всплывающем окне появится сообщение: в текущей системе может произойти сбой перезапуска. Как показано на рисунке ниже:

При нажатии кнопки Подтвердить или Закрыть всплывающее окно закрывается, и переключатель включается.

При обнаружении, если вышеперечисленные проблемы существуют одновременно, будет предложена только та, которая имеет наибольшую степень важности по отношению к текущей проблеме, и порядок важности будет следующим: Эта функция не поддерживает текущую систему на данный момент > Возможны сбои при перезагрузке текущей системы.

2.3.4 Уведомление о простое

Если функция "Автоматическая обработка времени простоя" не включена, этот элемент выделен серым цветом и не может быть отредактирован; если функция "Автоматическая обработка времени простоя" включена, этот элемент закрыт по умолчанию. Если эта функция включена, вы можете настроить напоминание по SMS, напоминание в сообщении платформы и напоминание по электронной почте для уведомления пользователей о времени простоя в соответствии с настроенными методами уведомления.

2.3.5 Настройки порта

По умолчанию порт "Downtime Handler" - 12100, если порт 12100 не работает, вы можете настроить здесь другой номер порта.

Номер порта должен быть между 1024 и 65535, рекомендуется 12100, иначе "Downtime Handling Tool" не может быть запущен, страница "Downtime Handling" не может быть открыта, и появляется сообщение об ошибке: Please enter a number between 1024 to 65535, recommended 12100.

После ввода нового номера порта нажмите кнопку "Test", если в новом номере порта есть какие-либо отклонения, появится всплывающее окно с сообщением: The port is abnormal, please reset it. Как показано на рисунке ниже:

Если на порту нет никаких отклонений, во всплывающем окне будет указано, что порт доступен, и Downtime Automation Tool перезапустится на новом порту после сохранения. Как показано на рисунке ниже:

2.4 Обработка записей

Записи "Записи экспорта стека памяти" и "Записи перезагрузки сервера" фиксируют автоматическое создание записей DUMP-файлов и перезагрузку сервера соответственно. Они включают время начала и продолжительность экспорта (перезагрузки), успешность или неуспешность, а в случае неудачи - причину сбоя. Как показано на рисунке ниже:

Примечание: В журнал считываются только записи обработки простоев за последний месяц.

3. Клиент

После запуска серверного проекта с правами администратора администратор может войти в клиентский интерфейс Downtime Tool, набрав http://IP:端口 (порт по умолчанию Downtime Automation Tool - 12100, если порт изменен, то здесь указывается измененный порт) на стороне браузера, как показано на следующем рисунке:

Супервизор может войти в пользовательский интерфейс после входа в систему с паролем учетной записи, вход в систему не удался 5 раз , чтобы заблокировать, ограничение 60 минут не может войти в систему; период действия входа в систему составляет 15 минут, таймаут автоматически выходит.

Примечание: Если пользователь заблокирован в результате входа в систему во время работы, ему необходимо вручную завершить процесс.

Пользовательский интерфейс, в основном, имеет две функции: мониторинг работы проекта и выходной стек, в правом верхнем углу есть кнопка "Выход", нажмите ее, чтобы выйти из системы. Как показано на рисунке ниже:

3.1 Оперативный мониторинг

При мониторинге работы проекта,если сервер работает нормально, на экранеотображается: Normal operation in progress. Это показано на следующем рисунке:

Если произошел простой, на экране отобразится: Down, processing. Это показано на следующем рисунке:

После простоя инструмент автоматически обрабатывается, пользователь может вручную завершить работу инструмента для решения проблемы простоя, после завершения работы отображается страница: прекращена автоматическая обработка простоя, пожалуйста, перезагрузите систему вручную в своевременной манере. Как показано на рисунке ниже:

После простоя, когда гаджет перезапускает проект, если гаджету не удается перезапустить проект, на странице появляется сообщение: downtime automatic restart failed, please restart the system manually in time. Как показано на следующем рисунке:

3.2 Выходной стек

Пользователи могут экспортировать файлы стека потоков и стека памяти в "Export Stack", щелкните соответствующее место для экспорта. Как показано на рисунке ниже:

Экспорт успешно завершен: вывод успешный, в противном случае выдается сообщение о сбое, местоположение файла выходного стека: %Tomcat%\logs\FineLog\ date