Исследователи из Университета Тохоку и VISTEC обучили ИИ на данных о ходьбе палочника и перенесли полученную функцию вознаграждения на шестиногого робота RedMirror. В симуляции робот научился ходить за час, а затем продемонстрировал ходьбу в реальности.
Международная группа исследователей под руководством Университета Тохоку (Япония) и Видьясиримедхийского института науки и технологий (VISTEC, Таиланд) обучила ИИ на коротком фрагменте данных о ходьбе палочника, чтобы выявить структуру вознаграждения и стратегию управления, лежащие в основе его походки. Полученную функцию вознаграждения перенесли на модель шестиногого робота, который научился ходить примерно за час обучения в симуляции.
В симуляции выученный алгоритм управления также позволил роботу передвигаться по неровной поверхности и адаптироваться к потере одной ноги. После обучения стратегию управления перенесли на физического шестиногого робота RedMirror компании VISTEC, внеся поправку на различия сигналов датчиков. Настоящий робот продемонстрировал скоординированную ходьбу, подтвердив перенос метода из симуляции на физическую машину.
Метод
Команда использовала открытый набор данных, охватывавший всего три-четыре цикла ходьбы насекомого. С помощью обратного обучения с подкреплением ИИ определял цель ходьбы насекомого и то, как должны двигаться ноги для её достижения. Модель разделяет информацию на две части: одна описывает принципы, применимые к разным типам тел, другая учитывает особенности конкретной машины. Благодаря этому выученную функцию вознаграждения можно переносить на других роботов.
С новой функцией вознаграждения робот научился ходить примерно втрое быстрее, чем при использовании стандартной. Новый подход позволяет отказаться от ручной настройки правил движения каждой ноги для каждой новой машины.
Следующим шагом исследователи планируют добавить память, чтобы робот мог накапливать опыт. В перспективе такие высокомобильные машины могут использоваться, например, при спасательных работах в зонах бедствий.