В работе представлена методика автоматизированного поиска оптимального вектора атаки на основе иерархического глубокого обучения с подкреплением, адаптированная к условиям частичной наблюдаемости, стохастической динамики и реактивного противодействия систем защиты. Предложенная иерархическая архитектура разделяет процесс принятия решений на стратегический и тактический уровни, что позволяет справляться с проблемой экспоненциального роста пространства действий в сложных сетевых средах. Среда реализует частично наблюдаемый марковский процесс принятия решений с механизмами вероятностного обнаружения и адаптивной защиты. Экспериментальная валидация продемонстрировала способность системы обнаруживать робастные стратегии атаки при средней успешности достижения цели 73%.
< ... >
This paper presents a methodology for the automated search of an optimal attack vector based on Hierarchical Deep Reinforcement Learning, tailored to environments characterized by partial observability, stochastic dynamics, and active defense countermeasures. The proposed hierarchical architecture decomposes the decision-making process into strategic and tactical levels, thereby mitigating the challenge of exponential action space expansion in complex network environments. The simulation environment implements a Partially Observable Markov Decision Process incorporating mechanisms for probabilistic detection and adaptive defense. Experimental validation demonstrated the system’s capability to discover robust attack strategies, achieving an average success rate of 73%.
Keywords:
reinforcement learning, deep learning, penetration testing, attack graphs, information security, vulnerability analysis.