Эволюционное многоагентное обучение с подкреплением для оптимизации демографической политики с учетом кризисов

Эволюционное многоагентное обучение с подкреплением для оптимизации демографической политики с учетом кризисов



Дождиков А.В., Ситковский А.М.
Эволюционное многоагентное обучение с подкреплением для оптимизации демографической политики с учетом кризисов // Frontiers in Big Data. 2026. Т. 9. Ст. 1842233. (На англ. яз.)
ISSN 2624-909X
DOI: https://doi.org/10.3389/fdata.2026.1842233

Размещена на сайте: 12.08.26

Текст статьи на сайте журнала URL: https://www.frontiersin.org/journals/big-data/articles/10.3389/fdata.2026.1842233/full (дата обращения 12.08.2026)



Ссылка при цитировании:

Дождиков А.В., Ситковский А.М. Эволюционное многоагентное обучение с подкреплением для оптимизации демографической политики с учетом кризисов // Frontiers in Big Data. 2026. Т. 9. Ст. 1842233. (На англ. яз.)
DOI: https://doi.org/10.3389/fdata.2026.1842233

Аннотация

Демографические системы сталкиваются с беспрецедентными вызовами, обусловленными одновременным протеканием кризисов. Традиционные методы статистической демографии и агентные модели часто не позволяют учесть нелинейные межрегиональные взаимодействия в периоды серьезных социально-экономических потрясений. Чтобы решить эту проблему, мы предлагаем MADDPG–EVO–DGM — гибридный алгоритм, который объединяет многоагентное глубокое обучение с подкреплением с принципами эволюционной оптимизации и метаобучения для моделирования региональных демографических процессов в условиях различных кризисных сценариев. Каждый регион рассматривается как автономный агент, который учится управлять рычагами демографической политики, в то время как периодические эволюционные «ускорители» преодолевают локальные оптимумы за счёт популяционных возмущений параметров сети агентов. Кроме того, механизм метаобучения, вдохновлённый «машиной Дарвина — Гёделя», адаптирует триггеры ускорителей, обеспечивая самосовершенствование в процессе обучения. Мы оцениваем модель MADDPG–EVO–DGM в имитационной среде, откалиброванной на основе реальных демографических данных по восьми федеральным округам Российской Федерации за период с 2000 по 2024 год, с учётом десяти одновременных кризисных сценариев (например, пандемия, геополитический конфликт, экономический коллапс). Эксперименты демонстрируют значительно более быструю сходимость и улучшенную производительность по сравнению с базовым алгоритмом MADDPG: гибридный подход обеспечивает более высокое итоговое среднее вознаграждение (252,57 против 243,07) и в 3,4 раза меньшую дисперсию сходимости (σ = 0,24 против 0,80), что указывает на более надёжное обучение. Кроме того, на этапах эволюции наблюдается качественный скачок производительности на +68 %, а устойчивость к кризисным потрясениям по сравнению с базовым уровнем повышается на 35–45 %. Насколько нам известно, это первое применение многоагентного обучения с подкреплением для крупномасштабного демографического моделирования в условиях кризисов, что открывает новые возможности для разработки научно обоснованной политики в области народонаселения, устойчивой к кризисам. Для обеспечения воспроизводимости результатов предоставляются код, данные и логи.

Ключевые слова:

демографическое моделирование множественные кризисы мультиагентное обучение с подкреплением (MARL) MADDPG эволюционные алгоритмы мета-обучение машина Дарвина-Гёделя региональная демография политика населения устойчивость к кризисам demographic modeling multiple crises multi-agent reinforcement learning (MARL) MADDPG evolutionary algorithms meta-learning Darwin-Gö del Machine regional demography population policy crisis resilience

Рубрики:

Социальная политика и управление
Социальная демография