Skip to content

Удаление дублирующихся строк

1. Обзор

1.1 Версия

Версия FineBIФункциональные изменения
6.0.7-

1.2 Сценарии применения

Сценарий 1: Работа с грязными данными

Эта функция полезна при работе с грязными данными и удалении дублирующихся строк.

Например: некоторые данные заказа случайно записались дважды. В заказе имеются сырые данные, чтобы их преобразовать, мы можем удалить функцию дублирования строк и сохранить только одну строку. Как показано на рисунке ниже:

52.png

Сценарий 2: Сохранение частичных данных

Пользователю нужно собрать данные о состоянии машины, но из-за случайного сбора данные распределяются неравномерно, и в минуту может быть собрано 10-20 записей. Вы можете использовать функцию "Удалить дублирующиеся строки", чтобы сохранить только одну часть данных в минуту.

Сценарий 3: Удаление дублирующихся строк

Требуемые данные находятся в таблице.

Можно удалить другие поля через настройки полей. Затем вы можете удалить дубликаты пользовательских данных с помощью функции "Удалить дубликаты строк". Как показано на рисунке ниже:

1.3 Функциональный профиль

Система определяет наличие дублирующихся строк по полю дублирования, выбранному пользователем. Если для поля дедупликации выбрано значение "Выбрать все", система будет определять наличие дублирующихся строк по всем полям.

Повторяйте строки, сохраняя первую строку данных.

2. Примеры

Скачать пример данных: order data.xlsx

1) Добавьте данные примера в тему анализа, как показано ниже:

2.png

Из данных в этой таблице видно, что есть заказы, учтенные дважды, и данные дублируются, только идентификатор заказа отличается.

2) Добавьте "Удалить дубликаты строк", как показано ниже:

4.png

(3) Система в соответствии с выбранным полем деэмфазиса определяет, есть ли дублирующиеся строки. Если дата заказа совпадает, имя заказчика одинаковое, сумма заказа одинаковая, то в принципе можно определить, что это один и тот же заказ.

Поэтому в качестве основы для определения наличия или отсутствия дубликатов выбираются три поля "Дата заказа, Имя клиента, Продажи", как показано на рисунке ниже:

Примечание: После оценки дубликатов система по умолчанию сохраняет данные первой строки. Например, если A1000005 дублируется с A1000006, сохраняются только данные первой A1000005.

5.png

4) Нажмите "Сохранить и обновить", чтобы получить данные без дублирующихся значений.

Здесь также приведен список того, что вы получите, если вы выберете различные поля дедупликации:

Де-взвешенные поляв конце концов
Выберите только "Регион"Для каждого региона хранится только одна информация о заказе:
Выберите только "Имя клиента"Для каждого пользователя хранится только одна информация о заказе:

3. Рекомендации по применению

Определив, какие строки дублируются, система по умолчанию сохранит первую строку данных в первом ряду.

Поэтому выполнение операции "Удаление дубликатов строк" на разных этапах может привести к тому, что первая строка данных, которую система решит сохранить, не будет одинаковой. Рекомендуется, чтобы пользователи старались выполнять операцию "Удалить дубликаты строк" в качестве последнего шага.