Vertica коннектор#
Vertica коннектор позволяет отправлять запросы и создавать таблицы в СУБД Vertica. Коннектор может быть использован для объединения данных из Vertica с данными из других источников.
Требования#
Vertica версии 9.1.x или выше.
Наличие сетевого доступа к Vertica со всех узлов CedrusData (coordinator и worker). По умолчанию, Vertica использует порт 5433.
Конфигурация#
Для создания каталога Vertica установите параметр connector.name
в значение cedrusdata_vertica
.
Например, для конфигурации каталога с именем example
создайте файл etc/catalog/example.properties
со следующим содержимым.
Замените параметры подключения в соответствии с конфигурацией вашего сервера Vertica.
connector.name=cedrusdata_vertica
connection-url=jdbc:vertica://<host>
connection-user=<username>
connection-password=<password>
Параметр connection-url
определяет JDBC строку подключения к серверу Vertica.
Параметры connection-user
and connection-password
определяют имя пользователя и пароль для подключения к экземпляру Vertica (как правило, это сервисный пользователь).
Если вы не хотите хранить имя пользователя и пароль в открытом виде воспользуйтесь функционалом передачи секретов через переменные окружения.
Защищенное подключение#
Если ваш экземпляр Vertica сконфигурирован с использованием TLS сертификатов, вы можете включить поддержку TLS между кластером CedrusData и Vertica
путем добавления необходимых параметров к строке подключения, указанной в connection-url
.
Аутентификация в источнике данных#
Вы можете предоставить имя пользователя и пароль для подключения к источнику данных несколькими способами:
INLINE
- в файле конфигурации каталога (в том числе, используя секреты, чтобы не хранить значения в открытом виде).FILE
- в отдельном properties файле.KEYSTORE
- в зашифрованном keystore файле.Из extra credentials клиента CedrusData.
Название |
Описание |
---|---|
|
Тип credential provider. Допустимые значения: |
|
Имя пользователя для подключения к источнику. Используется при |
|
Пароль для подключения к источнику. Используется при |
|
Путь к properties файлу, содержащему параметры |
|
Путь к keystore файлу, из которого следует прочитать имя пользователя и пароль. Используется при |
|
Тип keystore файла. Например, |
|
Пароль к keystore файлу. |
|
Имя keystore entity, содержащей имя пользователя для подключения к источнику. |
|
Пароль к keystore entity, содержащей имя пользователя для подключения к источнику |
|
Имя keystore entity, содержащей пароль для подключения к источнику. |
|
Пароль к keystore entity, содержащей пароль для подключения к источнику. |
|
Имя параметра extra credentials, значение которого следует использовать в качестве имени пользователя. См. |
|
Имя параметра extra credentials, значение которого следует использовать в качестве пароля. См. |
Аутентификация в источнике данных от имени текущего пользователя#
В дополнение к описанным выше способам аутентификации, CedrusData поддерживает аутентификацию в источнике от имени текущего пользователя CedrusData.
Для использования данного типа аутентификации узел должен использовать PASSWORD
аутентификацию с включенным параметром
cedrusdata.http-server.authentication.password.populate-extra-credentials
. Убедитесь, что файл config.properties содержит следующие параметры:
http-server.authentication.type=PASSWORD
cedrusdata.http-server.authentication.password.populate-extra-credentials=true
В файле конфигурации коннектора добавьте два параметра:
user-credential-name=cedrusdata.username
password-credential-name=cedrusdata.password
Теперь коннектор будет использовать имя и пароль текущего пользователя для аутентификации в источнике.
При использовании аутентификации от имени текущего пользователя CedrusData другие параметры аутентификации коннектора будут проигнорированы.
Несколько экземпляров Vertica#
Vertica коннектор может работать только с одним экземпляром Vertica. Если у вас есть несколько экземпляров Vertica вам следует сконфигурировать несколько каталогов Vertica коннектора, каждый из которых будет работать с конкретным экземпляром Vertica.
Общие параметры конфигурации#
Название |
Описание |
Значение по умолчанию |
---|---|---|
|
Включить поддержку case insensitive идентификаторов. |
|
|
Время жизни закэшированных метаданных о case insensitive идентификаторах. Значение имеет тип duration. |
|
|
Путь к файлу конфигурации в формате JSON, который позволяет разрешать конфликты имен между case insensitive схемами и таблицами. |
|
|
Частота проверки обновлений файла |
|
|
Время жизни закэшированных метаданных (дескрипторы таблицы и колонок, статистики). Положительное значение включает кэширование. Значение имеет тип duration. |
|
|
Кэшировать ли информацию о том, что для используемых таблиц и колонок отсутствуют статистики. Включение данного
параметра может ускорить планирование некоторых запросов. Однако, если информация об отсутствии статистик для
конкретного объекта СУБД закэширована, но статистики стали доступны позднее (например, была запущена
команда |
|
|
Время жизни закэшированных имен схем. Положительное значение включает кэширование. Допустимо только, если
параметр |
|
|
Время жизни закэшированных имен таблиц. Положительное значение включает кэширование. Допустимо только, если
параметр |
|
|
Время жизни закэшированных статистик. Положительное значение включает кэширование. Допустимо только, если
параметр |
|
|
Максимальное количество объектов, хранящихся в metadata cache. |
|
|
Максимальное количество команд в batch операциях записи данных. Изменение данного параметра не рекомендовано, так как оно может негативно сказаться на производительности. |
|
|
Использовать ли динамические фильтры при работе с JDBC источником. |
|
|
Максимальное время ожидания готовности динамических фильтров с build стороны оператора join перед запуском JDBC запроса к источнику. Увеличение таймаута может позволить CedrusData выполнить запрос к источнику с более селективными фильтрами, но в то же время может увеличить latency некоторых запросов. Значение имеет тип duration. |
|
Добавление комментариев к SQL-запросам к источнику#
Опциональный параметр query.comment-format
позволяет добавить комментарий, который будет добавлен к каждому SQL-запросу, отправляемому из CedrusData в источник.
Значение параметра может содержать произвольные символы, а также набор специальных выражений, которые будут автоматически заменены CedrusData:
$QUERY_ID
: Уникальный идентификатор запроса.$USER
: Имя пользователя CedrusData, который инициировал выполнение запроса.$SOURCE
: Идентификатор клиентского приложения. Например,trino-cli
.$TRACE_TOKEN
: Trace token, заданный клиентским приложением.
Вы также можете добавить в комментарий значения переменных окружений CedrusData с помощью синтаксиса ${ENV:VARIABLE-NAME}
.
Пример ниже добавляет комментарий «Query sent by Trino» к каждому запросу к SQL-источнику:
query.comment-format=Query sent by Trino
Пример SQL-запроса, отправленного к источнику:
SELECT * FROM example_table; /*Query sent by Trino.*/
Пример ниже добавляет специальные выражения в строку комментария:
query.comment-format=Query $QUERY_ID sent by user $USER from Trino.
Если пользователь Jane
отправил запрос с идентификатором 20230622_180528_00000_bkizg
, то источник получит SQL-запрос со следующим комментарием:
SELECT * FROM example_table; /*Query 20230622_180528_00000_bkizg sent by user Jane from Trino.*/
Примечание
Некоторые JDBC-драйвера могут автоматически удалять комментарии.
Domain compaction threshold#
CedrusData позволяет делегировать применение предикатов источнику данных (pushdown). Во многих случаях это существенно
уменьшает количество записей, которые возвращает источник, и улучшает производительность. Однако, pushdown сложных
предикатов (например, выражение IN
со множеством значений) может негативно сказаться на производительности.
При достижении порога сложности предиката, CedrusData автоматически преобразует предикат к более компактной форме.
Например, предикат a IN (1, 2, ..., 100)
может быть преобразован в a BETWEEN 1 AND 100
. В большинстве случаев
такое преобразование улучшает производительность запросов. Однако, в некоторых случаях может быть предпочтительнее
передать сложный предикат в неизменном виде, так как источник данных может его обработать эффективнее, чем
преобразованный предикат.
Вы можете увеличить значение порога сложности, чтобы CedrusData передавал предикат в источник без изменений.
Используйте для этого параметр конфигурации каталога domain-compaction-threshold
или
свойство сессии domain_compaction_threshold
.
Case insensitive идентификаторы#
Когда параметр конфигурации case-insensitive-name-matching
установлен в true
, CedrusData может обращаться к
схемам и таблицам источника, имена которых не являются lowercase. Для этого CedrusData сопоставляет lowercase название
схемы или таблицы с ее реальным названием в источнике данных. Например, если таблица в источнике данных имеет название
Customers
, CedrusData позволяет обратиться к ней по имени customers
.
В случае, если источник имеет несколько объектов, имена которых отличаются только регистром (например, Customer
и
customer
), CedrusData не может автоматически определить, к какому объекту обращаться.
В этом случае вы можете явно задать сопоставление имен с помощью файла в JSON формате, путь к которому следует указать
в параметре конфигурации каталога case-insensitive-name-matching.config-file
. Например:
{
"schemas": [
{
"remoteSchema": "CaseSensitiveName",
"mapping": "case_insensitive_1"
},
{
"remoteSchema": "cASEsENSITIVEnAME",
"mapping": "case_insensitive_2"
}],
"tables": [
{
"remoteSchema": "CaseSensitiveName",
"remoteTable": "tablex",
"mapping": "table_1"
},
{
"remoteSchema": "CaseSensitiveName",
"remoteTable": "TABLEX",
"mapping": "table_2"
}]
}
В данном случае, при обращении из CedrusData к схеме case_insensitive_1
, запрос будет переадресован к схеме
источника CaseSensitiveName
, а при обращении из CedrusData к таблице case_insensitive_1.table_1
запрос будет
переадресован к таблице источника CaseSensitiveName.tablex
.
По умолчанию если вы изменяете содержимое данного файла, экземпляр CedrusData должен быть перезапущен, чтобы применить
изменения. Если вы хотите изменять содержимое файла без перезапуска CedrusData, вы можете установить параметр
конфигурации case-insensitive-name-mapping.refresh-period
, который определяет частоту повторного чтения данного
файла.
case-insensitive-name-mapping.refresh-period=30s
Неатомарный INSERT#
Коннектор поддерживает добавление записей в источник с помощью команды INSERT statements. По умолчанию CedrusData осуществляет запись данных, используя временную таблицу, что обеспечивает транзакционные гарантии: в источник будут записаны либо все данные, либо не будет записано ничего (в случае возникновения ошибки).
Вы можете осуществлять запись данных в таблицу источника напрямую, минуя временную таблицу.
Для этого установите параметр конфигурации каталога insert.non-transactional-insert.enabled
или свойство сессии non_transactional_insert
в значение true
.
Изменение данного параметра может увеличить производительность записи, но может привести
данные в источнике в неопределенное состояние при возникновении ошибки в момент записи.
Например, если при вставке 10 записей в таблицу источника в середине процесса произошла ошибка,
откат вставки уже сохраненных записей может оказаться невозможным, и после выполнения команды
источник будет содержать только часть записей.
Поддержка fault-tolerant execution#
Коннектор поддерживает Fault-tolerant execution. Операции чтения и записи могут быть выполнены с любой retry policy.
Приведение типов#
Так как CedrusData и Vertica могут поддерживать типы данных, которые не поддерживаются другой стороной, коннектор Vertica переопределяет некоторые типы данных при осуществлении операций чтения и записи.
Приведение типов Vertica к типам CedrusData#
Коннектор Vertica приводит типы Vertica к типам CedrusData согласно таблице ниже.
Тип Vertica |
Тип CedrusData |
Комментарий |
---|---|---|
|
|
|
|
|
Vertica имеет одинаковое 64-битное представление для типов |
|
|
Vertica имеет одинаковое представление для типов |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Другие типы данных не поддерживаются.
Приведение типов CedrusData к типам Vertica#
Коннектор Vertica приводит типы CedrusData к типам Vertica согласно таблице ниже.
Тип CedrusData |
Тип Vertica |
Комментарий |
---|---|---|
|
|
|
|
|
Vertica имеет одинаковое 64-битное представление для типов |
|
|
Vertica имеет одинаковое 64-битное представление для типов |
|
|
Vertica имеет одинаковое 64-битное представление для типов |
|
|
Vertica имеет одинаковое 64-битное представление для типов |
|
|
Vertica имеет одинаковое представление для типов |
|
|
Vertica имеет одинаковое представление для типов |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Другие типы данных не поддерживаются.
Обработка DECIMAL типов#
CedrusData по умолчанию игнорирует колонки с типом данных DECIMAL
без явного указания precision или scale.
Если значение параметра конфигурации коннектора decimal-mapping
(или параметра сессии decimal_mapping
) равно allow_overflow
,
то колонки с типом данных DECIMAL
без явного указания precision или scale будут отображены и сопоставлены с типом данных CedrusData DECIMAL(38,0)
.
Используйте параметр конфигурации коннектора decimal-default-scale
(или параметр сессии decimal_default_scale
), чтобы задать другое значение scale
.
Значение precision
всегда равно 38
.
Если DECIMAL
значение не умещается в заданные precision и scale без округления, CedrusData вернет ошибку.
Вы можете изменить данное поведение, разрешив автоматическое округление значение с помощью параметра конфигурации коннектора
decimal-rounding-mode
или параметра сессии decimal_rounding_mode
.
Допустимые значения: UNNECESSARY
(значение по умолчанию), UP
, DOWN
, CEILING
, FLOOR
, HALF_UP
, HALF_DOWN
, HALF_EVEN
.
Данные значения соответствуют поведению RoundingMode в Java 17.
Конфигурация сопоставления типов#
Следующие параметры конфигурации могут быть использованы для изменения логики приведения типов.
Название |
Описание |
Значение по умолчанию |
---|---|---|
|
Как обрабатывать колонки неподдерживаемых типов: |
|
|
Список типов данных источника, которые должны быть принудительно приведены к |
Работа с Vertica#
Vertica коннектор предоставляет каждую схему Vertica в качестве отдельной схемы каталога CedrusData.
Используйте команду SHOW SCHEMAS
для получения списка схем каталога example
:
SHOW SCHEMAS FROM example;
Если экземпляр Vertica содержит схему web
, вы можете получить список таблиц схемы с помощью команды SHOW TABLES
:
SHOW TABLES FROM example.web;
Используйте команды DESCRIBE
и SHOW COLUMNS
для получения списка колонок таблицы:
DESCRIBE example.web.clicks;
SHOW COLUMNS FROM example.web.clicks;
Пример команды SELECT
для получения данных из таблицы clicks
схемы web
:
SELECT * FROM example.web.clicks;
Поддержка SQL команд#
Vertica коннектор поддерживает команды чтения и изменения данных и метаданных экземпляра Vertica. В дополнение к общим командам и командам чтения коннектор поддерживает следующие операции:
UPDATE#
Команда UPDATE
позволяет изменять значения колонок только на константные значения:
UPDATE table SET col1 = 1 WHERE col3 = 1
Арифметические выражения, вызовы функций и иные выражения, не являющиеся константами, не поддерживаются в SET
.
Следующий запрос вернет ошибку, так как арифметические выражения не могут быть использованы в SET
:
UPDATE table SET col1 = col2 + 2 WHERE col3 = 1
Все колонки записи таблицы не могут быть обновлены одновременно.
Например, если таблица table
содержит три колонки, следующий запрос вернет ошибку:
UPDATE table SET col1 = 1, col2 = 2, col3 = 3 WHERE col3 = 1
DELETE#
Команда DELETE
с выражением WHERE
работает только в случае, когда выполнение предиката может быть полностью делегировано источнику.
ALTER TABLE RENAME TO#
Коннектор поддерживает переименование таблиц только в пределах одной схемы.
Следующая команда поддерживается коннектором, так как переименовывает таблицу в пределах одной схемы.
ALTER TABLE example.schema_one.table_one RENAME TO example.schema_one.table_two
Следующая команда не поддерживается коннектором, так как меняет схему таблицы:
ALTER TABLE example.schema_one.table_one RENAME TO example.schema_two.table_two
ALTER SCHEMA#
Коннектор поддерживает переименование схемы с помощью команды ALTER SCHEMA RENAME
.
Команда ALTER SCHEMA SET AUTHORIZATION
не поддерживается.
Процедуры#
system.flush_metadata_cache()
#
Очистить кэш JDBC метаданных. Команда ниже очищает кэш метаданных всех схем в каталоге example
.
USE example.example_schema;
CALL system.flush_metadata_cache();
system.execute('query')
#
Процедура execute
позволяет запустить SQL запрос к источнику в неизменном виде.
Данная процедура полезна, когда вам требуется воспользоваться специфичным синтаксисом источника, который недоступен в CedrusData.
В отличие от табличных функций query
и raw_query
данная процедура позволяет запускать SQL-запросы, который не возвращают записи
(например, DML и DDL команды).
Запрос из процедуры будет исполнен в источнике как есть, без дополнительных проверок доступа к конкретным объектам источника на стороне CedrusData.
Пример использования процедуры для вызова команды ALTER TABLE
на источнике:
USE example.example_schema;
CALL system.execute(query => 'ALTER TABLE your_table ALTER COLUMN your_column DROP DEFAULT');
Табличные функции#
Коннектор предоставляет ряд табличных функций для обработки данных Vertica.
query(varchar) -> table
#
Табличная функция query
позволяет запустить конкретный запрос к Vertica с использованием нативного синтаксиса Vertica.
Запрос будет выполнен в Vertica как есть без каких-либо изменений.
Данный функционал может быть полезен, если вам требуется задействовать специфичный функционал Vertica
(например, нестандартный синтаксис или хинты или для ускорения запроса) или получить полный контроль над тем,
какой запрос будет выполнен в Vertica.
Предупреждение
Нативный запрос, переданный в источник, должен возвращать набор записей (result set). CedrusData не осуществляет проверку доступа текущего пользователя к объектам источника, задействованным в нативном запросе. Используйте нативные запросы только для чтения данных.
Пример табличной функции query
для сканирования таблицы tpch.nation
:
SELECT
*
FROM
TABLE(
example.system.query(
query => 'SELECT
*
FROM
tpch.nation'
)
);
Примечание
Полиморфные табличные функции не сохраняют оригинальный порядок записей в результате запроса. Есть переданный
запрос содержит запрос выражение ORDER BY
, функция может вернуть записи в ином порядке. Для восстановления
требуемого порядка используйте ORDER BY
в запросе CedrusData.
Производительность#
Vertica коннектор содержит набор оптимизаций производительности, приведенный в последующих секциях.
Пул соединений (connection pool)#
Коннектор поддерживает работу через пул соединений с помощью библиотеки HikariCP. В ряде случаев использование пула соединений может ускорить запросы к источнику данных.
CedrusData создает по одному пулу соединений на каждого пользователя, который подключается к источнику:
Если вы аутентифицируетесь в источнике от имени общего системного пользователя, будет создан один пул.
Если вы используете Аутентификация в коннекторах от имени текущего пользователя, то будет создано по одному пулу на каждого активного пользователя CedrusData, но не более
cedrusdata.jdbc.connection-pool.max-users
. Создание большого количества соединений может негативно сказать на источнике. Мы рекомендуем вам провести нагрузочное тестирование, чтобы убедиться, что преимущества пула соединений перевешивают риски, при использовании совместно с аутентификацией в источнике от имени текущего пользователя.
Каждый пул может содержать до cedrusdata.jdbc.connection-pool.max-user-connections
соединений.
Название |
Описание |
Значение по умолчанию |
---|---|---|
|
Использовать ли пул соединений при подключении к источнику. |
|
|
Максимальное количество пулов соединений, которое может быть создано. Если необходимо создать новый пул для пользователя, но общее количество пулов достигло предела, будет закрыт один из давно неиспользуемых пулов. Значение данного параметра не имеет значения, если вы аутентифицируетесь в источнике от имени общего системного пользователя, так как в этом случае всегда будет использован ровно только пул. |
|
|
Максимальное количество подключений к источнику в рамках одного пула. |
Равно количеству процессорных ядер |
|
Как долго удерживать пул пользователя открытым в случае отсутствия активности последнего. |
|
|
Как долго удерживать соединение открытым в случае отсутствия активности. |
|
Статистики таблиц#
Vertica коннектор может использовать статистики колонок и таблиц для {doc}`cost-based оптимизации запросов</optimizer/cost-based-optimizations>.
Сбор статистик осуществляет экземпляр Vertica, после чего передает их CedrusData. Используйте команду ANALYZE
для сбора статистик таблиц.
ANALYZE table_schema.table_name;
Pushdown#
Коннектор поддерживает pushdown следующих операций:
Коннектор поддерживает pushdown агрегатных функций:
avg()
(кроме типаDECIMAL
)count()
(включая модификаторDISTINCT
)stddev()
(только для типаDOUBLE
)stddev_pop()
(только для типаDOUBLE
)stddev_samp()
(только для типаDOUBLE
)variance()
(только для типаDOUBLE
)var_pop()
(только для типаDOUBLE
)var_samp()
(только для типаDOUBLE
)covar_pop()
(только для типаDOUBLE
)covar_samp()
(только для типаDOUBLE
)corr()
(только для типаDOUBLE
)regr_intercept()
(только для типаDOUBLE
)regr_slope()
(только для типаDOUBLE
)
Примечание
Коннектор осуществляет pushdown для улучшения производительности запросов. Коннектор не будет делать pushdown конкретной операции, если это может привести к некорректным результатам. Таким образом коннектор предпочитает корректность производительности. В некоторых случаях коннекторы могут предоставлять дополнительные параметры конфигурации, которые разрешают pushdown небезопасных операций, но только при явном указании соответствующего параметра пользователем.
Cost-based join pushdown#
Коннектор поддерживает Join pushdown в режимах AUTOMATIC
(значение по умолчанию) и EAGER
.
В режиме AUTOMATIC
коннектор принимает решение о join pushdown на основе предполагаемой стоимости запроса с и без join pushdown.
Join pushdown происходит только тогда, когда доступные Table statistics позволяют предположить, что join pushdown приведет к улучшению производительности.
Если статистики задействованных таблиц и колонок недоступны, join pushdown не будет произведен, чтобы избежать потенциального ухудшения производительности.
В режиме EAGER
join pushdown происходит всегда, когда это допустимо коннектором с точки зрения корректности, даже если соответствующие статистики недоступны.
Использование режима EAGER
рекомендовано только для тестирования и отладки.
Таблица ниже содержит параметры конфигурации, относящиеся к cost-based join pushdown:
Название |
Описание |
Значение по умолчанию |
---|---|---|
|
Разрешать :ref: |
|
|
Стратегия принятия решения о join pushdown. Допустимые значения: |
|
Поддержка predicate pushdown#
Коннектор поддерживает pushdown предикатов для большинства типов данных и следующих операций:
Арифметические операции:
+
,-
,*
,/
,%
Логические операции:
AND
,OR
,NOT
,LIKE
,IS NULL
,IS NOT NULL
,NULLIF
Операции сравнения:
=
,<>
,>
,>=
,<
,<=
,IN
Коннектор не поддерживает pushdown типа данных TIME
, так как в Vertica проверка значений 00:00
и 24:00
на равенство возвращает FALSE
, тогда как Trino ожидает TRUE
.