Учёные восстановили алгоритм MD5 из «чёрного ящика» нейросети с 2500 слоями
Группа исследователей смогла извлечь функциональность алгоритма MD5 из глубокой нейронной сети с 2500 слоями, которую ранее обучили для выполнения этой функции. Это удалось благодаря методам механистической интерпретируемости, сочетанию SAT-солверов и логических рассуждений.
Нейронные сети часто работают как «чёрные ящики», чья внутренняя логика остаётся непонятной даже для разработчиков. В данном случае перед учёными стояла задача разобраться, как именно глубокая сеть из 2500 слоёв преобразует входные данные в хеш MD5, не имея доступа к исходному коду её тренировки.
Для решения задачи исследователи применили механистическую интерпретируемость — область ИИ, которая занимается изучением внутренних механизмов моделей. Они анализировали веса и связи между нейронами, чтобы понять, какие операции сеть выполняет на каждом уровне. Использование SAT-солверов, инструментов для решения булевых формул, помогло проверить выдвигаемые гипотезы о логике работы отдельных частей сети. Работа заняла несколько месяцев и включала как успешные, так и тупиковые направления поиска, но в итоге привела к полному восстановлению алгоритма MD5, который был «зашит» в модель.
Этот прецедент открывает новые возможности для анализа сложных моделей ИИ, позволяя понять их внутреннюю структуру и, возможно, выявить непреднамеренные функции или уязвимости. Подобные исследования важны для повышения прозрачности и надёжности систем искусственного интеллекта, особенно в критически важных областях.
Часто задаваемые вопросы
Что такое механистическая интерпретируемость нейросетей?
Механистическая интерпретируемость — это научное направление, изучающее внутренние механизмы и логику работы нейронных сетей, позволяющее понять, как модель принимает те или иные решения.
Что такое SAT-солверы и как они помогают анализировать нейросети?
SAT-солверы — это программы для решения задач выполнимости булевых формул. Они используются для проверки гипотез о логике работы отдельных компонентов нейросети, помогая выявить её скрытые алгоритмы.
Почему важно понимать, как работают нейросети-«чёрные ящики»?
Понимание внутренней работы нейросетей важно для выявления скрытых функций, потенциальных уязвимостей, повышения надёжности и безопасности ИИ-систем, особенно в критически важных приложениях.
Источник: Habr · Rusability ИИ


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!