petrochemРазведка
АктуальноеНовости и поискГраф связейИнтерактивО проекте
поиск/
petrochem.insight
о проекте

Платформа технологической разведки и отраслевой агрегатор новостей нефтехимической промышленности: технологии, проекты, оборудование, рынки, безопасность, моделирование.

разделы
  • Актуальное (дайджест)
  • Новости и поиск
  • Граф связей
  • О проекте
источники

Данные агрегируются из открытых отраслевых источников. Мнение редакции может не совпадать с мнением источников.

© 2026 Нефтехимическая разведка · v0.1.0-dev

built with next.js · directus · pgvector

~/news/modeling/process_design_rl_transfer
Моделирование2025-04-13 · 15 мин

Автоматизированное проектирование процессов с использованием обучения с подкреплением и переносом обучения

Проектирование технологических схем — итеративный процесс. Агент ИИ на основе обучения с подкреплением и переноса обучения научился собирать оптимальные схемы в симуляторе DWSIM. Перенос обучения сократил время сходимости в 2 раза, а итоговая схема дала на 8% больше выручки.

ProcessDesignReinforcementLearningDWSIMОптимизация
modeling

Автоматизированное проектирование процессов с использованием обучения с подкреплением и переносом обучения

Вот перевод и адаптация статьи на русский язык, выполненный в соответствии с вашими требованиями: профессиональный, развернутый, с сохранением всех цифр, дат, имен и технических деталей.


Перенос обучения для проектирования технологических процессов с использованием обучения с подкреплением

Цинхэ Гао (Qinghe Gao)⁸, Хаоюй Ян (Haoyu Yang)⁸, Шачи М. Шанбхаг (Shachi M. Shanbhag)⁸, Артур М. Швайдтманн (Artur M. Schweidtmann)⁸,*

⁸Группа исследований интеллектуальных технологических процессов (Process Intelligence Research Team), Кафедра химической инженерии, Делфтский технологический университет (Delft University of Technology), Van der Maasweg 9, Делфт, 2629 HZ, Нидерланды

*Автор для корреспонденции. Эл. почта: a.schweidtmann@tudelft.nl

Аннотация

Проектирование технологических процессов — это творческая задача, которая в настоящее время выполняется инженерами вручную. Искусственный интеллект открывает новые возможности для упрощения этого процесса. В частности, обучение с подкреплением (Reinforcement Learning, RL) продемонстрировало определенные успехи в автоматизации проектирования процессов. Это достигается путем интеграции моделей, основанных на данных, которые обучаются создавать технологические схемы (flowsheets) с использованием имитационного моделирования процессов в итеративном цикле проектирования. Однако одной из главных проблем в процессе обучения является то, что RL-агент требует огромного количества симуляций в строгих симуляторах процессов, что влечет за собой длительное время расчетов и высокие вычислительные затраты. Поэтому для ускорения обучения обычно используются упрощенные (short-cut) методы симуляции. Однако такие методы могут приводить к неточным результатам. В связи с этим мы предлагаем использовать перенос обучения (transfer learning) для проектирования процессов с помощью RL в сочетании со строгими методами симуляции. Перенос обучения — это известный подход в машинном обучении, который позволяет сохранять знания, полученные при решении одной задачи, и повторно использовать их для решения другой, целевой задачи. Мы интегрировали перенос обучения в нашу RL-структуру для проектирования процессов и применили её к иллюстративному примеру, включающему равновесные реакции, азеотропную рекомбинацию и рециклы. Наш метод позволяет разрабатывать экономически эффективные технологические схемы при стабильном взаимодействии с симулятором DWSIM. Полученные результаты показывают, что перенос обучения позволяет RL-агенту экономически эффективно создавать работоспособные схемы в DWSIM, что приводит к увеличению дохода технологической схемы на 8%. При этом время обучения может быть сокращено в 2 раза.

Ключевые слова: обучение с подкреплением, проектирование технологических процессов, перенос обучения.

1. Введение

Переход химической инженерии к устойчивому и цикличному будущему требует новых методов проектирования процессов (Fantke et al., 2021). В настоящее время методы проектирования процессов в основном представляют собой ручной труд, требующий длительного времени разработки. Методы, основанные на суперструктурах (superstructure methods), также ограничены заранее заданными конфигурациями процессов (Chen et al., 2017; Mitsos et al., 2018). В последнее время обучение с подкреплением (RL), один из разделов машинного обучения (Machine Learning, ML), демонстрирует многообещающие результаты в области проектирования процессов (Midgley et al., 2020; Khan et al., 2020; Göttl et al., 2021; Stops et al., 2022; Kalmthout et al., 2022). Одной из главных проблем при использовании RL для проектирования процессов является процесс обучения, основанный на методе проб и ошибок. В результате процесс обучения обычно требует проведения большого количества имитационных симуляций, что сопряжено с высокими вычислительными затратами. В предыдущих работах (Khan et al., 2020; Göttl et al., 2021; Stops et al., 2022) в основном использовались упрощенные методы симуляции для эффективного моделирования процессов, что может приводить к неточным результатам. В недавних работах применяются строгие симуляторы процессов, такие как COCO и Aspen Plus, с использованием строгих моделей (Midgley et al., 2020; Kalmthout et al., 2022). Тем не менее, проблема длительного времени симуляции препятствует дальнейшему развитию (Kalmthout et al., 2022).

Мы предлагаем использовать перенос обучения при проектировании процессов с помощью RL для повышения эффективности и результативности процесса обучения. Перенос обучения — это техника, позволяющая улучшить производительность обучения за счет переноса знаний из другой, но релевантной предметной области на целевую область (Zhu et al., 2020). Адаптируя концепцию переноса обучения для проектирования процессов с помощью RL, мы сначала предварительно обучаем нашего недавно предложенного RL-агента на упрощенной симуляции процесса из нашей предыдущей работы (Stops et al., 2022). Затем мы переносим предварительно обученного агента в строгий симулятор процессов DWSIM для дальнейшего обучения. Наконец, мы демонстрируем влияние переноса обучения на примере одного тематического исследования.

2. Методы

Задача RL может быть сформулирована как марковский процесс принятия решений (Markov Decision Process, MDP): M = {S, A, T, R}, который включает состояния s ∈ S, действия a ∈ A, переходы T: S × A и функции вознаграждения R. Цель агента — максимизировать вознаграждение в среде, последовательно выполняя действия, оценивая текущее вознаграждение и обновляя состояния.

В частности, в задачах синтеза технологических процессов состояния соответствуют технологическим схемам. Действия состоят из двух частей: дискретных и непрерывных действий. Дискретные действия включают выбор тип технологической операции (unit operation) и ее местоположение в технологической схеме. Непрерывные действия определяют проектные и эксплуатационные параметры соответствующей технологической операции. После того как агент выполнил действия, состояния обновляются. На основе текущего состояния среда, например, программное обеспечение для имитационного моделирования процессов, рассчитывает вознаграждение, которое затем возвращается агенту в качестве обратной связи о его действиях. Для проектирования процессов это вознаграждение обычно представляет собой целевую функцию, такую как доход от процесса. Многократно повторяя процесс выполнения действий и получения вознаграждений, агент обучается выполнять действия, которые приводят к более высокому вознаграждению, что соответствует технологическим схемам с более высоким доходом.

2.1. Агент и среда

Мы адаптируем структуру RL из нашей предыдущей работы (Stops et al., 2022), где состояния представлены в виде направленных графов технологических схем. В этих направленных графах узлы представляют технологические операции, а ребра соответствуют технологическим потокам. Каждому узлу и ребру присваивается соответствующий вектор признаков, хранящий информацию о технологической операции (например, тип или размер) и потоке (например, термодинамические данные или расход потока). Кроме того, архитектура агента состоит из трех основных частей: кодировщика графов (graph encoder), сетей актора (actor networks) и сетей критика (critic networks). Кодировщик графов принимает текущие графы технологических схем в качестве входных данных и использует графовые свертки в графовых нейронных сетях (Graph Neural Networks, GNN) для изучения информации о графах схем в виде векторного представления, также называемого отпечатком (fingerprint) технологической схемы. Сети актора отвечают за выполнение действий в процессе обучения. Существует три уровня действий: выбор открытого потока, выбор технологической операции и выбор соответствующей проектной переменной. Кроме того, принимая отпечаток технологической схемы в качестве входных данных, сети критика используются для оценки вознаграждения за действия, а затем сети актора обучаются выполнять действия с наибольшим ожидаемым вознаграждением. В частности, вознаграждение рассчитывается с использованием симулятора процессов DWSIM (Medeiros et al., 2018). Структура RL реализована на языке Python и включает интерфейс для активного взаимодействия агента с DWSIM.

2.2. Перенос обучения

Мы расширяем нашу структуру RL за счет переноса обучения. В частности, мы добавляем фазу предварительного обучения к тренировке агента. На этапе предварительного обучения мы используем среду упрощенной симуляции процессов (Stops et al., 2022) и обучаем агента в течение 10 000 эпизодов. Затем мы переносим предварительно обученного агента на фазу точной настройки (fine-tuning), в ходе которой агент обучается на строгом симуляторе процессов DWSIM в течение дополнительных 15 000 эпизодов обучения. Для сравнения мы напрямую обучаем другого агента в среде DWSIM в течение 15 000 эпизодов. Обратите внимание, что в каждом эпизоде агент генерирует полную технологическую схему. Как процессы предварительного обучения, так и точной настройки адаптированы из алгоритма PPO (Proximal Policy Optimization) от OpenAI (Schulman et al., 2017). Затем архитектура агента обновляется с помощью градиентного спуска для функции общих потерь, полученной суммированием потерь сетей актора, потерь сетей критика и соответствующих энтропий.

Агенты обучались на сервере под управлением Windows с процессором Intel(R) Xeon(R) W-2265 (3.5 ГГц, 24 ядра), графическим процессором NVIDIA GeForce RTX 3090 и 64 ГБ оперативной памяти.

3. Иллюстративный пример

В качестве иллюстративного примера был выбран процесс производства метилацетата (MeOAC).

3.1. Моделирование процесса

Упрощенные методы моделирования для предварительного обучения описаны в нашей предыдущей работе (Stops et al., 2022). Здесь представлено моделирование процесса с помощью DWSIM. В этом тематическом исследовании агент может выбирать реакторы, ректификационные колонны и теплообменники в качестве технологических операций. Кроме того, агент может также решить добавить рециклы или объявить открытые потоки продуктами. Типы технологических операций и соответствующие проектные переменные определены следующим образом.

Реактор используется для преобразования реагентов в целевой продукт (MeOAc). Реактор моделируется как реактор идеального вытеснения (Plug Flow Reactor, PFR), в котором протекает следующая обратимая реакция: HOAc + MeOH ⇌ MeOAc + H₂O (1) Для простоты эксплуатации реактор моделируется в изотермическом режиме, при котором температура поддерживается постоянной относительно температуры входного потока. Кроме того, загрузка катализатора не учитывается. Кинетика реакции взята из работы (Xu et al., 1996), при этом константа равновесия зависит от температуры. Площадь поперечного сечения реактора определяется соотношением: N/10, где N — молярный расход на входе (Stops et al., 2022). Проектной переменной является длина реактора, которая будет определяться агентом на третьем уровне непрерывного процесса принятия решений. Диапазон значений составляет от 3 до 10 м.

Ректификационная колонна применяется для отделения MeOAc от четырехкомпонентной системы. Вместо упрощенных колонн, использовавшихся в предыдущей работе (Stops et al., 2022), применяются строгие модели ректификационных колонн, чтобы учесть более реалистичные факторы, такие как межмолекулярные взаимодействия. Строгие модели колонн предоставляют несколько возможных вариантов выбора проектных параметров, из которых в качестве решения третьего уровня выбирается отношение дистиллята к питанию (D/F). Другие регулируемые параметры, такие как число тарелок и флегмовое число, установлены как фиксированные значения (35 и 1,5 соответственно). Отношение D/F может варьироваться от 0,4 до 0,6.

Теплообменник представляет собой модель нагревателя DWSIM. В предложенной структуре теплообменник моделируется на основе температуры на выходе, которая определяется решением третьего уровня. Применяется диапазон температур от 278,15 K до 330,05 K, где верхний предел относится к самой низкой температуре кипения компонентов, которой является MeOAc.

Действие рецикла состоит из дополнительных блоков, включая делитель и смеситель. Сначала технологический поток разделяется на рецикловый поток и продувку. Затем рецикловый поток объединяется с выбранным питанием с помощью смесителя. При этом коэффициент разделения является решением третьего уровня агента и для практических соображений находится в диапазоне от 0,1 до 0,9.

3.2. Вознаграждение

Вознаграждение определяет экономическую целесообразность сгенерированных технологических схем и обучает агента выполнять реализуемые действия. Во-первых, вознаграждение в размере 0 € выдается, когда незавершенные технологические схемы могут сходиться после каждого отдельного действия, поскольку экономическую ценность незавершенной схемы оценить сложно. Во-вторых, всякий раз, когда агенту не удается выполнить симуляцию из-за невыполнимых действий, эпизод немедленно завершается, и выдается отрицательное вознаграждение в размере -10 млн €. Наконец, когда технологическая схема завершена, мы рассчитываем вознаграждение в соответствии с Уравнением 2:

r = ΣP_prod - ΣC_feed - Σ(C_op + 0.15 ⋅ C_inv)ᵤₙᵢₜₛ (2)

где P_prod — это доход от проданного продукта (Seider et al., 2008), C_feed — затраты на сырье, C_op — эксплуатационные расходы (Smith, 2016), а C_inv — общие капитальные вложения, которые умножаются на коэффициент 0,15 (Seider et al., 2008). В случае отрицательного вознаграждения применяется понижающий коэффициент 10, чтобы стимулировать исследование агентом.

4. Результаты и обсуждение

На Рисунке 1 представлены кривые обучения для агентов с переносом обучения и без него. Показатели представляют собой скользящее среднее вознаграждений, то есть экономической эффективности технологических схем, за 100 эпизодов. Обучение агента без переноса обучения заняло 72 часа на 10 000 эпизодов. Для агента с переносом обучения предварительное обучение заняло 2 часа на 10 000 эпизодов, а последующее обучение заняло 72 часа на 10 000 эпизодов.

В течение первых 3500 эпизодов агент без переноса обучения генерирует преимущественно нереализуемые длинные технологические схемы, в результате чего кривые обучения растут медленно. Фактически, из-за сложности пространства проектирования агенту трудно учиться на предыдущих неудачных схемах, что приводит к отрицательным показателям. После 3500 эпизодов агент в основном создает схемы с положительными показателями, что указывает на экономическую целесообразность спроектированных процессов. Кроме того, в течение эпизодов обучения кривая обучения медленно сходится и достигает максимума около 42. Для сравнения, агент с переносом обучения демонстрирует более быстрый процесс обучения. В начале процесса обучения агент способен в основном получать положительные показатели, а затем кривая обучения резко идет вверх. Это демонстрирует, что агент успешно использует предварительно обученную информацию из среды упрощенного моделирования для принятия благоприятных решений даже на ранних стадиях обучения. После примерно 4500 эпизодов показатель начинает колебаться между 30 и 40 и достигает максимума 46, что выше, чем у агента без переноса обучения.

Рисунок 1: Кривые обучения агента с переносом обучения и без него. Синяя линия показывает кривую обучения с переносом обучения, а оранжевая линия — кривую обучения без переноса обучения. Показатели представляют собой скользящее среднее вознаграждений за 100 эпизодов, и каждая кривая обучения построена за 10 000 эпизодов.

На Рисунке 2 показана наилучшая технологическая схема, сгенерированная агентом с переносом обучения, а непрерывные проектные переменные приведены в Таблице 1. Во-первых, сырье (F1) подается непосредственно в три последовательных реактора (R1, R2 и R3), где MeOAc и H₂O производятся в результате этерификации HOAc и MeOH. Затем полученная четырехкомпонентная смесь разделяется в колонне (C1). Смесь перегоняется из верхней части колонны и направляется в один теплообменник (Hex1) для получения продукта (P1), содержащего обогащенный MeOAc и остатки HOAc и H₂O. Кубовый продукт первой колонны далее разделяется во второй колонне (C2) для получения чистой H₂O в дистилляте (P2) и смеси MeOH и H₂O в третьем потоке продукта (P3). При этом 90% кубового продукта рециркулирует и смешивается обратно с сырьем.

Хотя полученная технологическая схема имеет положительное вознаграждение, она все еще далека от реалистичного инженерного решения, и требуются дальнейшие исследования. В частности, в оптимальном решении технологической схемы наблюдаются три основные проблемы: (1) В промышленных приложениях MeOAc в основном производится в реакционно-ректификационных колоннах (Huss et al., 2003). Поскольку наш агент не включает реакционную ректификацию в качестве технологической операции, это не может быть идентифицировано. В будущей работе в нашу структуру могут быть добавлены интенсифицированные технологические операции, или агент может работать на уровне явлений, а не на уровне типовых операций. (2) Наилучшая технологическая схема, сгенерированная агентом в этой работе, содержит три последовательных PFR. Причина в том, что длина одного PFR ограничена 10 м, чего недостаточно для завершения реакции. Поэтому агент учится выбирать несколько PFR для проведения реакции и максимизации выхода продукта. (3) Один ненужный теплообменник добавлен после ректификационной колонны C1 и перед продуктом P1. Мы полагаем, что это связано с низкими эксплуатационными расходами теплообменников и незначительным влиянием на общее вознаграждение. Будущие исследования должны быть направлены на изучение возможных стратегий смягчения последствий, таких как более длительное обучение или дальнейшая настройка гиперпараметров.

Рисунок 2: Наилучшая технологическая схема, сгенерированная агентом с переносом обучения. Сначала MeOAc и H₂O производятся из сырья (F1) в трех последовательных реакторах (R1, R2 и R3). Затем смесь разделяется в первой колонне (C1). Первый продукт (P1) обогащен MeOAc, но также содержит остатки HOAc и H₂O после одного теплообменника (Hex1). Затем кубовая смесь MeOH и H₂O дополнительно разделяется во второй колонне (C2). Чистая H₂O находится в дистилляте (P2), а третий продукт (P3) представляет собой смесь MeOH и H₂O. При этом 90% P3 рециркулирует и смешивается с потоком сырья.

Таблица 1. Проектные переменные, выбранные агентом с переносом обучения в наилучшей технологической схеме.

Технологическая операцияПроектная переменнаяЕдиница изм.Лучший прогон
Реактор 1 (R1)Длинам9,42
Реактор 2 (R2)Длинам9,25
Реактор 3 (R3)Длинам8,38
Колонна 1 (C1)Отношение дистиллята к питанию-0,58
Колонна 2 (C2)Отношение дистиллята к питанию-0,4
Теплообменник 1 (Hex1)Температура на выходеK315
РециклКоэффициент рециркуляции-0,9

5. Заключение

Мы предлагаем использовать перенос обучения для проектирования процессов с помощью RL, чтобы ускорить процесс обучения агента. Агент на основе GNN сначала предварительно обучается в среде упрощенного моделирования, а затем переносится в среду строгого симулятора процессов для дальнейшего обучения. В иллюстративном примере агент способен разрабатывать экономически целесообразные технологические схемы в среде симулятора процессов DWSIM. Кроме того, кривые обучения демонстрируют, что перенос обучения действительно значительно повышает эффективность процесса обучения и, таким образом, может быть использован для существенного сокращения общего времени обучения. Таким образом, данная работа демонстрирует, что перенос обучения может ускорить процесс обучения графовых RL-агентов в средах со строгими симуляторами процессов.

Литература

  1. Chen, Q., & Grossmann, I. E. (2017). Recent developments and challenges in optimization-based process synthesis. Annu. Rev. Chem. Biomol. Eng, 8(1), 249-283.
  2. Fantke, P., Cinquemani, C., Yaseneva, P., De Mello, J., Schwabe, H., Ebeling, B., & Lapkin, A. A. (2021). Transition to sustainable chemistry through digitalization. Chem, 7(11), 2866-2882.
  3. Göttl, Q., Grimm, D. G., & Burger, J. (2022). Automated synthesis of steady-state continuous processes using reinforcement learning. Frontiers of Chemical Science and Engineering, 16(2), 288-302.
  4. Huss, R. S., Chen, F., Malone, M. F., & Doherty, M. F. (2003). Reactive distillation for methyl acetate production. Computers & chemical engineering, 27(12), 1855-1866.
  5. Khan, A., & Lapkin, A. (2020). Searching for optimal process routes: a reinforcement learning approach. Computers & Chemical Engineering, 141, 107027.
  6. Midgley, L. I. (2020). Deep Reinforcement Learning for Process Synthesis. arXiv preprint arXiv:2009.13265.
  7. Mitsos, A., Asprion, N., Floudas, C. A., Bortz, M., Baldea, M., Bonvin, D., ... & Schäfer, P. (2018). Challenges in process optimization for new feedstocks and energy sources. Computers & Chemical Engineering, 113, 209-221.
  8. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347.
  9. Seider WD, Lewin DR, Seader JD, Widagdo S, Gani R, Ng KM. Product and process design principles: Synthesis, analysis, and evaluation (4th edition). Hoboken, NJ: Wiley. 2017.
  10. Smith R. Chemical process: Design and integration (2nd edition). Chichester, West Sussex, United Kingdom: Wiley. 2016.
  11. Stops, L., Leenhouts, R., Gao, Q., & Schweidtmann, A. M. (2022). Flowsheet generation through hierarchical reinforcement learning and graph neural networks. AIChE Journal, e17938.
  12. van Kalmthout, S. C., Midgley, L. I., & Franke, M. B. (2022). Synthesis of separation processes with reinforcement learning. arXiv preprint arXiv:2211.04327.
  13. Xu, Z. P., & Chuang, K. T. (1996). Kinetics of acetic acid esterification over ion exchange catalysts. The Canadian Journal of chemical engineering, 74(4), 493-500.
  14. Zhu, Z., Lin, K., & Zhou, J. (2020). Transfer learning in deep reinforcement learning: A survey. arXiv preprint arXiv:2009.07888.

Источник

Источник

Теги

  • #ProcessDesign
  • #ReinforcementLearning
  • #DWSIM
  • #Оптимизация

Источник: https://arxiv.org/pdf/2302.03375

#ProcessDesign #ReinforcementLearning #DWSIM #Оптимизация

конец материала
связанные материалы / related
теги
#ProcessDesign#ReinforcementLearning#DWSIM#Оптимизация