Физико-информированное машинное обучение для предсказания коэффициентов активности (Модель SPT-NRTL)
Модель SPT-NRTL использует трансформерную нейросеть для точного прогнозирования термодинамически консистентных коэффициентов активности. Она интегрирована в структуру уравнения NRTL, что гарантирует соблюдение уравнения Гиббса-Дюгема. Это позволяет инженерам получать параметры для симуляторов без дорогостоящих экспериментов.
Физико-информированное машинное обучение для предсказания коэффициентов активности (Модель SPT-NRTL)
Вот перевод и адаптация предоставленного текста научной статьи на русский язык. Текст сделан развернутым, профессиональным, с сохранением всех цифр, дат, имен и технических подробностей.
Название: SPT-NRTL: МОДЕЛЬ МАШИННОГО ОБУЧЕНИЯ, ОСНОВАННАЯ НА ФИЗИЧЕСКИХ ЗАКОНАХ, ДЛЯ ПРОГНОЗИРОВАНИЯ ТЕРМОДИНАМИЧЕСКИ СОГЛАСОВАННЫХ КОЭФФИЦИЕНТОВ АКТИВНОСТИ
ПРЕПРИНТ
Авторы: Бенедикт А. Винтер (Benedikt A. Winter) Кафедра энергетики и системотехники процессов (Energy and Process System Engineering) ETH Zürich Tannenstrasse 3, 8092 Цюрих, Швейцария bewinter@ethz.ch
Клеменс С. Винтер (Clemens S. Winter) OpenAI 3180 18TH St, CA 94110 Сан-Франциско, США clemenswinter1@gmail.com
Тимм Эспер (Timm Esper) ITT Университет Штутгарта (University of Stuttgart) Pfaffenwaldring 9, 70569 Штутгарт, Германия esper@itt.uni-stuttgart.de
Йоханнес Шиллинг (Johannes Schilling) Кафедра энергетики и системотехники процессов (Energy and Process System Engineering) ETH Zürich Tannenstrasse 3, 8092 Цюрих, Швейцария jschilling@ethz.ch
Андре Бардоу (André Bardow) ∗ Кафедра энергетики и системотехники процессов (Energy and Process System Engineering) ETH Zürich Tannenstrasse 3, 8092 Цюрих, Швейцария abardow@ethz.ch
28 сентября 2022 года
АННОТАЦИЯ
Доступность данных о свойствах веществ является одним из основных узких мест в разработке химических процессов, часто требуя трудоемких и дорогостоящих экспериментов или ограничивая пространство для поиска небольшим числом известных молекул. Это узкое место послужило стимулом для постоянного развития прогностических моделей свойств. Для прогнозирования свойств новых молекул методы групповых вкладов (group contribution methods) стали революционными. В последнее время к более устоявшимся моделям прогнозирования свойств присоединилось машинное обучение. Однако, несмотря на недавние успехи, интеграция физических ограничений в модели машинного обучения остается сложной задачей. Физические ограничения жизненно важны для многих термодинамических свойств, таких как соотношение Гиббса-Дюгема, что вносит дополнительный уровень сложности в прогнозирование. Здесь мы представляем SPT-NRTL — модель машинного обучения для прогнозирования термодинамически согласованных коэффициентов активности и предоставления параметров NRTL для удобного использования в моделировании процессов. Результаты показывают, что SPT-NRTL достигает более высокой точности, чем UNIFAC, при прогнозировании коэффициентов активности для всех функциональных групп и способен прогнозировать многие равновесия жидкость-пар с точностью, близкой к экспериментальной, что проиллюстрировано на примере смесей вода/этанол и хлороформ/н-гексан. Чтобы облегчить применение SPT-NRTL, с его помощью были рассчитаны и предоставлены онлайн параметры NRTL для 100 000 000 смесей.
Ключевые слова: машинное обучение, прогнозирование свойств, коэффициенты активности, COSMO-RS, UNIFAC
1. Введение
Практически безграничное количество молекул предлагает почти необозримое молекулярное пространство для химической технологии, в котором можно найти новые технологические материалы, такие как растворители и продукты. Однако ограниченность времени и экспериментальных ресурсов делает экспериментальное исследование этого молекулярного пространства нецелесообразным. Таким образом, цель исследования молекулярного пространства in silico стимулировала развитие прогнозирования молекулярных свойств. За эти годы исследования в области прогнозирования молекулярных свойств привели к появлению множества подходов, основанных, например, на QSPR [Katritzky et al., 1995, Hughes et al., 2008], квантовой механике [Klamt, 1995, Lin and Sandler, 2002, Schleder et al., 2019] и моделях групповых вкладов (GC) [Fredenslund et al., 1975, Marrero and Gani, 2001, Hukkerikar et al., 2012, Sauer et al., 2014]. В последнее время для прогнозирования молекулярных свойств были предложены подходы машинного обучения [Liu et al., 2019, Ding et al., 2021, Venkatasubramanian, 2019, Alshehri et al., 2021], которые, в зависимости от их архитектуры, можно интерпретировать как продвинутые методы групповых вкладов.
Среди множества молекулярных свойств, представляющих интерес для химической технологии, коэффициенты активности выделяются особо. Коэффициенты активности управляют фазовыми равновесиями в важнейших химических процессах, включая дистилляцию и экстракцию. Поскольку коэффициенты активности являются свойствами смесей, комбинаторная сложность смесей делает экспериментальное исследование всех представляющих интерес коэффициентов активности сложной задачей.
Исторически сложилось так, что модели групповых вкладов, такие как UNIFAC [Fredenslund et al., 1975], или квантово-химические модели, такие как COSMO-RS или COSMO-SAC [Klamt, 1995, Lin and Sandler, 2002], продемонстрировали многообещающие результаты в прогнозировании коэффициентов активности. Эти модели позволяют исследовать большие молекулярные пространства, для которых нет экспериментальных данных [Scheffczyk et al., 2016]. Однако из-за природы методов групповых вкладов UNIFAC не может прогнозировать свойства молекул, состоящих из непараметризованных групп. Напротив, квантово-химические модели, такие как COSMO, позволяют прогнозировать свойства для произвольных молекул, но требуют вычислительно затратных расчетов для каждой новой молекулы.
Чтобы преодолеть эти ограничения моделей GC и квантово-химических моделей и повысить общую точность, в последние годы было предложено несколько подходов машинного обучения для прогнозирования предельных коэффициентов активности. Эти подходы машинного обучения основаны на матричном заполнении (matrix completion) [Jirasek et al., 2020, Damay et al., 2021], коллаборативной фильтрации (collaborative filtering) [Tan et al., 2022] и графовых нейронных сетях (graph neural networks) [Sanchez Medina et al., 2022, Rittig et al., 2022] и в целом превосходят UNIFAC и COSMO-RS по точности, тем самым подчеркивая потенциал моделей машинного обучения для прогнозирования свойств.
Недавно мы представили так называемый SMILEStoPropertiesTransformer (SPT), модель машинного обучения для прогнозирования предельных коэффициентов активности на основе произвольных SMILES, использующую обработку естественного языка [Winter et al., 2022]. SPT почти вдвое уменьшает среднюю абсолютную ошибку по сравнению с UNIFAC и COSMO-RS при прогнозировании предельных коэффициентов активности. Более того, по сравнению с другими подходами машинного обучения, достигается более высокая точность при прогнозировании коэффициентов активности полностью неизвестных смесей. Благодаря общей многообещающей производительности и адаптируемости недавних подходов машинного обучения, машинное обучение, вероятно, станет неотъемлемой частью инструментария химической технологии для прогнозирования свойств [Dobbelaere et al., 2021].
Однако, хотя недавние успехи в прогнозировании предельных коэффициентов активности с использованием моделей машинного обучения являются многообещающими, использование таких моделей ограничено, поскольку большинство приложений в химической технологии требуют коэффициентов активности, зависящих от концентрации, для расчета фазовых равновесий. Таким образом, для широкого применения в химической технологии модели машинного обучения для прогнозирования коэффициентов активности должны удовлетворять трем требованиям: Во-первых, модель должна прогнозировать зависящие от концентрации коэффициенты активности с более высокой точностью, чем современные модели, такие как UNIFAC и COSMO-RS/SAC. Во-вторых, модель должна быть термодинамически согласованной. В-третьих, модель должна быть легко применима в стандартном программном обеспечении для моделирования процессов, которое инженеры используют ежедневно, для достижения высокого уровня внедрения.
Зависимость от концентрации и высокая точность, на которые указывает первое требование, вероятно, могут быть удовлетворены путем обучения модели на достаточно больших базах данных зависящих от концентрации коэффициентов активности, таких как Дортмундская база данных (Dortmund Datenbank) [Dortmund Datenbank, 2022]. Напротив, термодинамическая согласованность и широкое применение создают более фундаментальные проблемы для моделей машинного обучения. Как правило, базовая модель машинного обучения не гарантирует термодинамической согласованности или выполнения физических ограничений, поскольку в нее не включены физические знания. Для зависящих от концентрации коэффициентов активности уравнение Гиббса-Дюгема связывает производные коэффициентов активности друг с другом. Чтобы обеспечить термодинамическую согласованность, уравнение Гиббса-Дюгема должно быть подразумеваемо моделью коэффициента активности, например, путем выражения коэффициентов активности как производных избыточной энергии Гиббса. Интеграция физических знаний в модели машинного обучения является активной областью исследований, в рамках которой разработано множество подходов [Rajulapati et al., 2022], таких как прогнозирование параметров известных физических уравнений [Swischuk et al., 2019] или введение ограничений в функцию потерь или саму нейронную сеть [Beucler et al., 2021].
Третье требование касается универсальной применимости модели в стандартных инженерных инструментах, таких как программное обеспечение для моделирования процессов. В то время как отдельные, внутренние модели процессов, вероятно, могут адаптировать свои методы расчета свойств, прямая интеграция моделей машинного обучения в более коммерциализированное программное обеспечение для моделирования процессов пользователем обычно возможна лишь в ограниченной степени. Таким образом, желательны модели машинного обучения, которые прогнозируют не только термодинамические свойства, но и параметры устоявшихся моделей, поскольку их можно напрямую использовать в стандартном программном обеспечении для моделирования процессов.
Что касается прогнозирования зависящих от концентрации коэффициентов активности, Felton et al. [2022] недавно предложили графовую нейронную сеть для прогнозирования параметров полинома четвертой степени, аппроксимирующего коэффициенты активности, рассчитанные с помощью COSMO-RS. Модель машинного обучения Felton et al. [2022] позволяет прогнозировать зависящие от концентрации коэффициенты активности с небольшим отклонением от COSMO-RS, но с гораздо более высокой скоростью. Однако полином четвертой степени не обеспечивает термодинамической согласованности и не позволяет легко и просто интегрировать модель в стандартное программное обеспечение для моделирования процессов. Более того, поскольку модель обучается исключительно на данных COSMO-RS, ожидается, что ее точность будет не выше точности COSMO-RS. Насколько нам известно, в литературе до сих пор не существует модели машинного обучения для зависящих от концентрации коэффициентов активности, которая удовлетворяла бы всем вышеперечисленным требованиям.
В этой работе мы представляем модель машинного обучения для прогнозирования термодинамически согласованных, зависящих от концентрации коэффициентов активности бинарных смесей на основе SMILES-представления молекул. Для этой цели мы расширяем недавно предложенную авторами модель SPT для прогнозирования предельных коэффициентов активности [Winter et al., 2022], встраивая уравнение NRTL в «голову» (head) модели. Благодаря встроенному уравнению NRTL, результирующая модель, названная SPT-NRTL, обеспечивает внутренне согласованные по Гиббсу-Дюгему коэффициенты активности. Более того, SPT-NRTL внутренне прогнозирует параметры NRTL, которые могут быть легко использованы во многих стандартных программах моделирования процессов, включая Aspen Plus [AspenTech, 2022], gPROMS [PSE, 2022] или AVEVA [AVEVA, 2022], что позволяет легко применять результаты модели в существующем программном обеспечении для химической технологии.
2. Архитектура модели SPT-NRTL
Модель SPT-NRTL должна обеспечивать расчет термодинамически согласованных, зависящих от концентрации коэффициентов активности бинарных смесей с использованием обработки естественного языка. В этом разделе представлена архитектура модели SPT-NRTL (Рисунок 1). Архитектура SPT-NRTL основана на архитектуре модели естественного языка GPT-3 [Brown et al., 2020], использующей архитектуру трансформера только с декодером (decoder-only transformer), разработанную Vaswani et al. [2017]. Архитектура трансформера доказала свою пригодность не только для понимания грамматики естественного языка, но и молекулярной грамматики, закодированной в SMILES-кодах — линейном текстовом представлении молекул, введенном Weininger [1988], что привело ко многим успешным применениям в области химии [Schwaller et al., 2019, Honda et al., 2019, Lim and Lee, 2021, Kim et al., 2021].
Далее мы представляем архитектуру SPT-NRTL, разбитую на три раздела: встраивание входных данных (input embedding) (Раздел 2.1), многоголовое внимание (multi-headed attention) (Раздел 2.2) и «голова» (head) (Раздел 2.3).
2.1 Встраивание входных данных
SPT-NRTL прогнозирует коэффициенты активности на основе SMILES-кодов входных компонентов. SMILES-коды стали одним из стандартных молекулярных представлений для машинного обучения в химической технологии со многими недавними применениями [Honda et al., 2019, Wang et al., 2019, Schwaller et al., 2019, Lim and Lee, 2021]. SMILES-код, разработанный Weininger [1988], позволяет представить сложные разветвленные и циклические молекулы в виде линейной строки. В SMILES-кодах атомы кодируются символами периодической таблицы, например, символ "N" для азота, за исключением атомов водорода, которые подразумеваются неявно. Одинарные связи подразумеваются неявно, в то время как двойные или тройные связи представлены символами "=" и "#" соответственно. Ветви заключаются в скобки, а места соединения кольцевых структур обозначаются цифрами. Таким образом, например, молекула 2-этилфенола может быть представлена следующим SMILES: Oc1c(CC)cccc1.
Входные данные SPT-NRTL состоят из SMILES-кодов, представляющих молекулы в смеси, объединенных со специальными символами, обозначающими начало последовательности
Чтобы сделать входную строку читаемой для модели машинного обучения, входная строка токенизируется, что означает разбиение последовательности на токены, каждый из которых может быть представлен одним числом. В общем случае токены могут состоять из нескольких символов. Однако в этой работе каждый токен состоит из одного символа и ему присваивается уникальный номер. Вода, представленная SMILES 'O', имеет свой собственный токен. Процесс токенизации SMILES можно рассматривать как аналог присвоения групп первого порядка в методах групповых вкладов. Полный словарь, содержащий все токены, доступен в Разделе 1 вспомогательных материалов.
Затем входная последовательность кодируется с использованием one-hot кодирования, где каждый токен представлен изучаемым вектором размера nemb = 512. Входная матрица размера nemb × nseq строится путем объединения векторов, представляющих токены во входной последовательности. После кодирования входной последовательности справа к входной матрице добавляется дополнительный вектор, который может содержать линейную проекцию непрерывных переменных в пространство вложений. В случае оригинальной модели SPT [Winter et al., 2022] в этом векторе кодируется информация о температуре. Однако могут быть включены и другие непрерывные переменные, такие как давление, мольная доля и т.д. В SPT-NRTL здесь не подаются непрерывные переменные, поскольку информация о температуре и мольной доле поступает в модель только на последнем этапе (см. Рисунок 1).
После добавления непрерывных переменных результирующая входная матрица имеет размер nemb × (nseq + 1). Затем к входной матрице добавляется изучаемое позиционное кодирование размера nemb × (nseq + 1). На этом этапе входная матрица содержит информацию обо всех атомах и связях в молекулярной структуре компонентов смеси, а также об их положении. Однако каждый токен не имеет информации об окружающих его токенах, поскольку информация между токенами еще не передавалась. Этот обмен информацией между токенами будет происходить в следующем разделе — многоголовом внимании.
2.2 Многоголовое внимание
В разделе многоголового внимания несколько блоков многоголового внимания (multi-headed attention blocks) располагаются друг над другом. Внутри каждого блока входные данные сначала нормализуются с помощью слоевой нормализации (layer norm), а затем передаются механизму многоголового внимания. Внутри механизма многоголового внимания информация передается между токенами. В то время как отдельные токены после кодирования входа содержат информацию только о себе, механизм многоголового внимания позволяет токенам получать информацию о своих соседях или других интересующих атомах в своей собственной молекуле или даже в других молекулах смеси. Таким образом, блок трансформера можно интерпретировать как самообучающийся метод групповых вкладов n-го порядка, где каждый токен, или наименьшая возможная группа, изучает важность других токенов, а затем самоорганизуется в группы более высокого порядка на основе структуры молекулы.
На математическом уровне выход Zi одной головы внимания i определяется как: Zi = softmax((Qi Ki^T) / √dk) Vi где Qi — матрица запросов (query matrix), Ki — матрица ключей (key matrix), Vi — матрица значений (value matrix), а dk = demb / nhead, где nhead — количество голов внимания. Выходные данные Zi каждой головы i объединяются и проецируются до размера nemb × (nseq + 1), который передается в многослойный персептрон (MLP), завершающий блок трансформера. Для более глубокого и наглядного объяснения читатель отсылается к блогу Alammar [2018] или нашей предыдущей работе [Winter et al., 2022].
2.3 «Голова» (Head)
В разделе «голова» размерность выхода блока многоголового внимания уменьшается, и применяются физические ограничения. Сначала применяются слоевая нормализация, а затем функция максимума (max) вдоль размерности последовательности, что уменьшает выход до размера nemb × 1. Результат проходит через многослойный персептрон (MLP), а затем поступает в NRTL-голову (NRTL-head). Архитектура NRTL-головы показана на Рисунке 2. Введение экспоненциальной функции NRTL в голову модели машинного обучения вносит нестабильность в процесс обучения, часто приводя к расходимости модели во время тренировки. Таким образом, в NRTL-голову включено несколько мер для повышения стабильности.
Внутри NRTL-головы входной вектор сначала нормализуется в слоевой нормализации, а затем линейно проецируется с nemb на количество параметров NRTL npar = 10 (a1-2, t12,1-4, t21,1-4). После этого параметры NRTL рассчитываются из выхода X линейного слоя следующим образом, с использованием сигмоидной функции и верхних и нижних границ для параметров NRTL: par = par_min * (1 + sig(X) / 10 * (par_max / par_min - 1)) где par_min и par_max — нижняя и верхняя границы для параметров NRTL, определенные на основе базы данных параметров NRTL, подобранных для широкого диапазона смесей в предыдущем исследовании [Scheffczyk et al., 2016]. Ограничение параметров NRTL улучшает сходимость обучения модели. Для параметров NRTL a1, t12,1 и t21,1 par_min и par_max не симметричны. Асимметричные границы обеспечивают лучшие начальные значения в начале обучения, где все параметры, вероятно, были бы средним значением верхней и нижней границы, и асимметричные границы, таким образом, приводят к ненулевым начальным значениям. После этого полученные параметры NRTL передаются в модель NRTL, приведенную в уравнениях (3)–(8). Мы предполагаем симметричный α в уравнении NRTL для совместимости с реализацией в программном обеспечении для моделирования технологических схем Aspen.
ln γ1 = x2^2 * [ τ21 * (G21 / (x1 + x2 * G21))^2 + τ12 * G12 / (x2 + x1 * G12)^2 ] ln γ2 = x1^2 * [ τ12 * (G12 / (x2 + x1 * G12))^2 + τ21 * G21 / (x1 + x2 * G21)^2 ] где ln G12 = -α τ12 ln G21 = -α τ21 и α = a0 + a1 * T τij = tij,0 + tij,1 / T + tij,2 * ln T + tij,3 * T
При вычислении уравнения NRTL автоматическое приведение чисел с плавающей запятой к FP16 отключается, и вместо него используется FP32 для повышения стабильности модели.
NRTL-голова возвращает ln γ1 и ln γ2 в качестве конечного выхода модели. Во время оценки параметры NRTL вычисляются внутренне и возвращаются в качестве дополнительного выхода модели. В то время как прогнозируемые коэффициенты активности зависят от входного состава и температуры, прогнозируемые параметры NRTL не зависят от состава и температуры и, таким образом, подходят для более широкого диапазона применения.
3. Данные о свойствах для обучения и валидации
Модели обработки естественного языка обычно требуют больших объемов обучающих данных для достижения высоких способностей к обобщению. Для прогнозирования физических свойств такие большие объемы экспериментальных обучающих данных часто недоступны. Таким образом, модели обработки естественного языка, прогнозирующие физические свойства, нуждаются в предварительном обучении (pretraining). Появились два варианта предварительного обучения: один основан на задачах автоматического перевода, которые сначала обучают модели грамматике SMILES перед введением данных о свойствах на последующем этапе [Honda et al., 2019], и другой, где используются синтетические данные [Winter et al., 2022, Vermeire and Green, 2021]. Насколько нам известно, на сегодняшний день не существует исследования, сравнивающего производительность обоих подходов. Для SPT-NRTL мы следуем подходу SPT и вводим начальный этап предварительного обучения на синтетических данных о свойствах, полученных из COSMO-RS. На втором этапе модель дообучается (fine-tuning) на экспериментальных данных. Далее описываются синтетические наборы данных (Раздел 3.1) и экспериментальные наборы данных (Раздел 3.2).
3.1 Синтетические данные для предварительного обучения
Для предварительного обучения нашей модели SPT-NRTL мы расширяем синтетический набор данных по предельным коэффициентам активности, уже использовавшийся для предварительного обучения нашей модели SPT [Winter et al., 2022]. Синтетический набор данных получен из базы данных COSMObase 2020, содержащей около 10 000 неионных компонентов. Для SPT обучающий набор данных содержал 5 миллионов точек данных, отобранных при бесконечном разбавлении и температуре 298.15 K, и 5 миллионов точек данных, отобранных при бесконечном разбавлении и случайной температуре между 278.15 K и 598.15 K (ср. Winter et al. [2022]). Для SPT-NRTL мы расширяем этот набор данных на 3 миллиона точек данных, отобранных при случайной концентрации при 298.15 K. Этот подход дает в общей сложности около 13 миллионов точек данных. Поскольку вода оказалась трудно прогнозируемой, мы дополнительно произвели выборку смесей воды со всеми другими компонентами пять раз при случайной концентрации и температуре между 278.15 K и 598.15 K. Чтобы добавить дополнительную вариативность данным и повысить устойчивость модели к порядку входных компонентов, в данные включены обе возможные перестановки порядка смеси, что дает в общей сложности 26 миллионов точек данных.
3.2 Экспериментальные данные для дообучения
Для дообучения модели доступны два экспериментальных набора данных: Во-первых, набор данных экспериментальных предельных коэффициентов активности на основе работы Brouwer et al. [2021], который ранее использовался для дообучения модели SPT. Набор данных был очищен от ошибок ввода данных и неопределенных компонентов (более подробно см. Winter et al. [2022]). Результирующий набор данных Brouwer (BRO) содержит 20 870 точек данных с 349 растворителями и 373 растворенными веществами в 6416 уникальных комбинациях при температурах от 250 K до 555.6 K.
Второй доступный набор данных рассчитан на основе наборов данных по равновесию жидкость-пар (VLE) и давлению пара (VAP) Дортмундской базы данных (DDB) [Dortmund Datenbank, 2022]. Мы рассматриваем только смеси с давлением ниже 5 бар и исключаем смеси расплавленных металлов. В целом, результирующий набор данных DDB зависящих от концентрации коэффициентов активности содержит 77 053 точки данных с 506 компонентами в 2302 уникальных комбинациях при температурах от 183.0 K до 973.15 K. Для рассматриваемого диапазона давлений мы предполагаем идеальную газовую фазу и пренебрегаем фактором Пойнтинга. Таким образом, зависящие от концентрации коэффициенты активности для набора данных DDB рассчитываются как: γi = (p * yi) / (p_sat,i * xi) где p — давление, yi — мольная доля компонента i в газовой фазе, p_sat,i — давление пара компонента i, а xi — мольная доля компонента i в жидкой фазе.
Распределение обучающих данных показано в Разделе 2 вспомогательных материалов.
Для оценки производительности нашей модели SPT-NRTL создаются три обучающих набора данных из наборов данных Brouwer и DDB:
- Brouwer: Содержит только набор данных Brouwer и, следовательно, только предельные коэффициенты активности.
- DDB: Содержит только набор данных DDB и, следовательно, только зависящие от концентрации коэффициенты активности без предельных коэффициентов активности.
- Full: Содержит как набор данных Brouwer, так и DDB, и, следовательно, предельные и зависящие от концентрации коэффициенты активности.
Эти три набора данных позволяют нам оценить, требуются ли большие коммерческие наборы данных для обучения точных моделей или достаточно меньших наборов данных с открытым исходным кодом, содержащих только предельные коэффициенты активности.
Для валидации модели мы следуем стратегии предыдущей модели SPT, определяя три валидационных набора [Winter et al., 2022]:
- Valint: Содержит бинарные смеси, где оба компонента присутствуют в обучающем наборе, но не в этой конкретной комбинации. Этот валидационный набор позволяет нам оценить способность модели к интерполяции в хорошо известных областях, где экспериментальные данные доступны для обоих компонентов, однако не для этой конкретной комбинации компонентов.
- Valedge: Содержит бинарные смеси, где либо растворитель, либо растворенное вещество присутствуют в обучающем наборе, но не оба. Этот валидационный набор позволяет нам оценить способность к экстраполяции на границе (edge-extrapolation) в областях, где известен только один компонент, например, когда необходимо идентифицировать новый растворитель для известного растворенного вещества.
- Valext: Содержит бинарные смеси, где ни растворитель, ни растворенное вещество не присутствуют в обучающем наборе. Этот валидационный набор позволяет нам оценить способность к экстраполяции в областях, где исследуются новые компоненты.
В целом, эти три валидационных набора позволяют проверить как способность модели SPT-NRTL к интерполяции, так и к экстраполяции.
Для создания трех валидационных наборов мы используем n-кратную перекрестную проверку (n-fold cross-validation): Сначала уникальные смеси всех объединенных наборов данных разбиваются на n наборов Valext. Затем для каждого набора данных i из n наборов Valext смеси, не входящие в Valext,i, но содержащие один компонент, входящий в смесь в Valext,i, сортируются в Valedge,i.
Впоследствии смеси, содержащиеся в валидационных наборах Valext,i и Valedge,i, удаляются из обучающих наборов, т.е. TrainBRO,i, TrainDDB,i и Trainfull,i. После этого 5 % смесей, оставшихся в обучающих наборах, отбираются в Valint,i, и все системы переоцениваются на предмет необходимости перемещения в другой валидационный набор из-за удаления Valint,i. Размеры результирующих наборов данных варьируются от 9 до 733 для Valext, от 9 до 733 для Valedge и от 9 до 733 для Valint из-за различной частоты измерений между смесями. Поскольку все данные используются для определения валидационных наборов, модель SPT-NRTL валидируется на аналогичных наборах данных, содержащих данные как из набора DDB, так и из набора Brouwer, независимо от набора данных, используемого для дообучения. Этот согласованный валидационный набор позволяет провести согласованное сравнение между последующими моделями.
4. Обучение SPT-NRTL
Начало обучения SPT-NRTL с только что инициализированной модели показало плохую сходимость и сходилось только при низких скоростях обучения (1×10⁻⁶), что приводит к высоким конечным потерям. Чтобы преодолеть нестабильность обучения, мы, следовательно, начинаем обучение модели SPT-NRTL не с только что инициализированной модели, а с предварительно обученной на предельных коэффициентах активности из COSMO-RS модели SPT [Winter et al., 2022], в которой раздел «голова» модели заменен с регрессионной головы на NRTL-голову. Благодаря этому модель уже имеет обученные разделы кодирования и многоголового внимания, когда она знакомится с данными, зависящими от концентрации. Это использование предварительно обученной модели для предварительного обучения повышает стабильность во время тренировки, снижает количество требуемого времени обучения, уменьшает конечные потери и позволяет использовать более высокие скорости обучения.
Сначала мы обучаем модель SPT-NRTL, инициализированную моделью SPT, на 26 миллионах точек данных синтетического набора COSMO в течение 10 эпох. Полученная модель дообучается на экспериментальных данных из наборов Brouwer, DDB и Full с использованием n-кратной перекрестной проверки в течение дополнительных 50 эпох. Предварительное обучение на синтетическом наборе COSMO занимает около 48 часов на 2080Ti, в то время как дообучение на экспериментальных данных занимает от 8 до 17 минут на 2080Ti, в зависимости от набора данных.
Поскольку обучение SPT-NRTL основано на SPT, гиперпараметры архитектуры модели остаются неизменными по сравнению с SPT. Подробная разбивка гиперпараметров приведена в Разделе 3 вспомогательных материалов. Во время предварительного обучения и дообучения используются скорость обучения 1×10⁻⁴ и функция потерь MSE.
5. Результаты: Прогнозирование зависящих от концентрации коэффициентов активности
5.1 Ошибка прогнозирования как функция концентрации
В следующем разделе мы сначала представляем результаты SPT-NRTL, дообученной на экспериментальных данных наборов Brouwer, DDB и Full (см. Раздел 3.2). Эти наборы данных позволяют нам проанализировать, как распределение обучающих данных по концентрации влияет на производительность дообученной модели. Три валидационных набора используются для оценки способности SPT-NRTL к интерполяции и (граничной) экстраполяции. Для этой оценки используется n-кратная перекрестная проверка, как описано в Разделе 4. Мы сравниваем производительность прогнозирования зависящих от концентрации коэффициентов активности с моделью UNIFAC. Для справедливого сравнения между SPT-NRTL и UNIFAC мы рассматриваем только те точки данных, которые могут быть рассчитаны как SPT-NRTL, так и UNIFAC. Поскольку вода всегда содержится в обучающих данных, Valext не содержит ни одной смеси с водой, что приводит к рассмотрению 304 952 точек данных для валидации всех моделей SPT-NRTL и UNIFAC. Как правило, водные смеси имеют высокий ln γ, и, следовательно, ln γ в целом ниже в Valext, поскольку в нем не содержится водных смесей, в отличие от Valedge и Valint. Это является причиной более низкой средней ошибки UNIFAC при прогнозировании смесей, содержащихся в Valext. Для Valedge рассматривается 349 796 точек данных для валидации SPT-NRTL и UNIFAC. Для Valint рассматривается только 119 116 точек данных для валидации, поскольку Valint содержит только смеси компонентов, которые являются частью как набора Brouwer, так и DDB. Средняя абсолютная ошибка (MAE) используется в качестве метрики для оценки качества прогнозирования. Поскольку ln γ увеличивается с уменьшением концентрации, мы анализируем среднюю абсолютную ошибку как функцию концентрации (см. Рисунок 3).
В целом, средняя абсолютная ошибка ln γ увеличивается для всех моделей и валидационных наборов с уменьшением концентрации. Эта тенденция является результатом общего увеличения ln γ с уменьшением концентрации, обычно достигающего максимума при бесконечном разбавлении (x = 0).
[Рисунок 3: Средняя абсолютная ошибка (MAE) прогнозируемых зависящих от концентрации коэффициентов активности ln γ для SPT-NRTL, дообученной на наборах данных Brouwer (STP-NRTL_Bro), DDB (STP-NRTL_DDB) и Full (STP-NRTL_Full), а также для UNIFAC. Граничные точки включают только точки данных с мольной долей, точно равной x = 0 или x = 1, в то время как все остальные точки усредняют ошибку по интервалу концентрации Δx = 0.1]
В целом, STP-NRTL_Full имеет самую низкую среднюю абсолютную ошибку во всем диапазоне концентраций для всех валидационных наборов. При бесконечном разбавлении STP-NRTL_Full имеет среднюю абсолютную ошибку 0.21 на Valint, 0.17 на Valedge и 0.2 на Valext по сравнению со средней абсолютной ошибкой 0.6, 0.47 и 0.36 для UNIFAC соответственно. Ошибка UNIFAC меняется в зависимости от валидационного набора, так как меняются прогнозируемые смеси. Лучшая производительность STP-NRTL_Full при бесконечном разбавлении по сравнению с интервалом концентрации Δx = (0, 0.1] в Valedge и Valint является результатом несбалансированного распределения концентраций в обучающих наборах данных. Набор данных Brouwer содержит приблизительно 50 % точек данных от набора DDB. Однако все данные Brouwer находятся при бесконечном разбавлении, в то время как точки данных набора DDB распределены по всему диапазону концентраций.
При высоких концентрациях (x > 0.7) STP-NRTL работает аналогично UNIFAC на всех трех валидационных наборах Valint, Valedge и Valext, независимо от набора данных, использованного для обучения SPT-NRTL (Brouwer, DDB или Full). Для концентраций выше x = 0.5 средняя абсолютная ошибка ниже 0.1 достигается для всех обучающих и валидационных наборов. При концентрациях ниже x = 0.5 SPT-NRTL превосходит UNIFAC по качеству прогнозирования, и различия между тремя обучающими наборами данных становятся более выраженными.
STP-NRTL_Bro и STP-NRTL_DDB обучены либо на данных при бесконечном разбавлении, либо на зависящих от концентрации данных без данных при бесконечном разбавлении, соответственно. Эта несбалансированность обучающих данных влияет на производительность прогнозирования моделей SPT-NRTL: STP-NRTL_DDB работает аналогично STP-NRTL_Full для большей части диапазона концентраций, за исключением прогнозирования при бесконечном разбавлении (x = 0), где средняя абсолютная ошибка значительно увеличивается. Это увеличение при бесконечном разбавлении является результатом того факта, что набор данных DDB, использованный для обучения STP-NRTL_DDB, не содержит точек данных при бесконечном разбавлении. Напротив, STP-NRTL_Bro имеет ошибку прогнозирования, близкую к UNIFAC для большей части диапазона концентраций, за исключением прогнозирования при бесконечном разбавлении, где средняя абсолютная ошибка значительно уменьшается. Это уменьшение является результатом того факта, что набор данных Brouwer, использованный для обучения STP-NRTL_Bro, содержит только данные при бесконечном разбавлении, но не содержит зависящих от концентрации данных. Однако, хотя для дообучения используются только экспериментальные данные при бесконечном разбавлении, предварительное обучение на синтетических данных и физическая основа NRTL-головы приводят к конкурентоспособной производительности STP-NRTL_Bro в прогнозировании зависящих от концентрации коэффициентов активности.
В целом, SPT-NRTL способен достигать более высокой точности, чем UNIFAC, особенно при низких концентрациях (x < 0.5). Дальнейшие улучшения качества прогнозирования SPT-NRTL могут быть достигнуты за счет использования более тщательно подобранных обучающих данных.
5.2 Производительность для молекулярных семейств
В предыдущем разделе была исследована корреляция между средней абсолютной ошибкой и концентрацией компонента для UNIFAC и моделей SPT-NRTL: STP-NRTL_Bro, STP-NRTL_DDB и STP-NRTL_Full. Однако ошибки прогнозирования молекулярных свойств обычно зависят от исследуемого молекулярного семейства (например, спирты или алканы) и, следовательно, от функциональных групп, присутствующих в молекулярной структуре молекулы [Brouwer and Schuur, 2019]. В этом разделе мы поэтому анализируем ошибку прогнозирования STP-NRTL_Full и UNIFAC в зависимости от функциональных групп, содержащихся в молекулярной структуре растворителя и растворенного вещества.
Мы фокусируем анализ на следующих молекулярных семействах: спирты, альдегиды, алифатические соединения, ароматические соединения, карбоновые кислоты, простые эфиры, галогены, кетоны и нитраты. Кроме того, мы рассматриваем воду как дополнительное молекулярное семейство. Чтобы изолировать эффекты для отдельных функциональных групп, мы рассматриваем только смеси молекул, которые содержат не более одной анализируемой функциональной группы в молекулярной структуре. Все молекулы с более чем одной соответствующей функциональной группой или функциональными группами, не охваченными исследуемыми молекулярными семействами, исключаются из анализа. Оставшиеся молекулы относятся к одному из десяти молекулярных семейств. Список всех молекул и их присвоенных групп доступен в Разделе 5 вспомогательных материалов.
Поскольку ошибка прогнозирования ln γ увеличивается с уменьшением концентрации, в этом анализе рассматриваются только точки данных ln γ с x < 0.3, чтобы охватить область низкой производительности. Компонент i с xi < 0.3 считается растворенным веществом, компонент j с xj = 1 - xi > 0.7 — растворителем. Для анализа рассматривается только коэффициент активности растворенного вещества. Чтобы рассчитать среднюю абсолютную ошибку для определенных комбинаций функциональных групп, мы рассматриваем все смеси, общие для UNIFAC и STP-NRTL_Full Valint. Сначала рассчитывается среднее значение средней абсолютной ошибки для каждой отдельной смеси в наборе данных, чтобы устранить смещение в сторону часто измеряемых смесей, например, вода-этанол. После этого полученные средние абсолютные ошибки усредняются в рамках каждой комбинации функциональных групп. Комбинации с менее чем пятью уникальными смесями отбрасываются (Рисунок 4).
[Рисунок 4: Тепловая карта средней абсолютной ошибки коэффициентов активности для xsolute < 0.3 для STP-NRTL_Full и UNIFAC в зависимости от функциональной группы растворителя и растворенного вещества. Тепловая карта имеет максимум 0.8 для иллюстративных целей. Средние абсолютные ошибки, превышающие 0.8, указаны явно. Столбец «среднее» (mean) дает среднюю абсолютную ошибку по всем группам.]
В качестве общей тенденции, STP-NRTL_Full имеет существенно более низкие ошибки прогнозирования, чем UNIFAC, для всех валидационных наборов и комбинаций функциональных групп (Рисунок 4). Для спиртов, альдегидов, алифатических и ароматических углеводородов, простых эфиров, галогенов и кетонов SPT-NRTL достигает очень высокого качества прогнозирования в диапазоне от 0.1 до 0.2, если вода не используется в качестве растворителя. По сравнению с этими функциональными группами, STP-NRTL_Full имеет немного более высокую ошибку прогнозирования для карбоновых кислот, нитратов и воды в качестве растворенных веществ и заметно более высокую ошибку прогнозирования для воды в качестве растворителя, где средняя ошибка составляет 0.5. Алифатические углеводороды, растворенные в воде, являются комбинацией групп с самой высокой средней абсолютной ошибкой, равной 1.3. Однако из-за сравнительно высокого абсолютного ln γ смесей алифатических углеводородов с водой ожидается более высокая средняя абсолютная ошибка. Для систем, содержащих воду, SPT-NRTL все еще значительно превосходит UNIFAC со средней абсолютной ошибкой 0.50 как на Valedge, так и на Valint (MAEmax = 1.3), в то время как UNIFAC имеет среднюю абсолютную ошибку по всем группам MAE = 1.3 для воды в качестве растворителя (MAEmax = 1.8).
За исключением воды в качестве растворенного вещества и растворителя, STP-NRTL_Full имеет самую высокую среднюю абсолютную ошибку для систем с карбоновыми кислотами в качестве растворенных веществ. В то время как средняя абсолютная ошибка других функциональных групп, используемых в качестве растворенных веществ, составляет от 0.1 до 0.25, ошибка для карбоновых кислот...
Источник
Теги
- #Термодинамика
- #MachineLearning
- #NRTL
- #AspenPlus
- #AVEVA
Источник: https://arxiv.org/pdf/2209.04135
#Термодинамика #MachineLearning #NRTL #AspenPlus #AVEVA