
Фото до статті
Олександр Остапенко
Автор новин
Розробник зі Славути, Одещини, відомий на GitHub під псевдонімом slvDev, показав, що для роботи великої мовної моделі не потрібен потужний відеоадаптер чи навіть повноцінний комп’ютер. Він створив проєкт ESP32-AI, в рамках якого LLM із 28,9 мільйонами параметрів функціонує на мікроконтролері ESP32-S3 — платі вартістю менш ніж $10.

Репозиторій з кодом ESP32-AI вже зібрав 3,5 тисячі зірок на GitHub та 440 форків, інформує The Register.
Як «вписати» в мікроконтролер
ESP32-S3 — це не найпотужніший пристрій: чіп має лише 512 КБ оперативної пам’яті SRAM, 8 МБ додаткової PSRAM та 16 МБ флеш-пам’яті. Для порівняння, сучасні LLM-моделі зазвичай потребують десятків або й сотень гігабайтів пам’яті, адже кожен параметр моделі займає від одного до чотирьох байтів.
Аби вміститися в ці мінімальні обсяги, розробник використав агресивну 4-бітну квантизацію — після цього оптимізована модель займає лише 14,9 МБ і повністю розміщується у вбудованій флеш-пам’яті плати.
Ключовим технічним рішенням став метод Per-Layer Embeddings (PLE), який розробила Google. За словами творця проєкту, це перша відома демонстрація адаптації цієї методики для настільки обмеженого апаратного забезпечення. Раніше подібні експерименти з мовними моделями на мікроконтролерах обмежувалися моделями обсягом приблизно 260 тисяч параметрів — отже, новий проєкт більш ніж у сто разів масштабніший за попередні.
Швидкість генерації на рівні людини — і жодного зв’язку з хмарою
Згідно з результатами тестів, модель генерує тексти зі швидкістю приблизно 9,88 токена за секунду — це швидше, ніж середньостатистична людина читає. Усі обчислення виконуються повністю локально на платі: жодні дані не передаються на сервери, весь процес — від навчання до генерації — відбувається ізольовано на самому чіпі.
Основна модель, навчена на датасеті TinyStories від Microsoft, здатна генерувати короткі та досить зв’язні історії. Розробник також створив другу модель під назвою Barista, яка відповідає на запитання — хоча й виключно щодо теми еспресо-кави, і працює приблизно вдвічі швидше за основну.
Чого не варто очікувати
Незважаючи на технічну вражаючість експерименту, його практична цінність є обмеженою:
- модель не підходить для створення чат-бота;
- вона не вміє генерувати програмний код;
- її не можна застосувати для побудови автономного ШІ-агента;
- функціонал обмежений генерацією простих історій або (у випадку Barista) відповідей на вузькоспеціалізовані теми.
Слава С. виклав на GitHub повний код прошивки, скрипти для навчання моделі, конвеєр квантизації, схему підключення та результати експериментів — відтак, кожен бажаючий може самостійно відтворити цей проєкт.
Попри «іграшковий» характер результату, сам факт роботи повноцінної мовної моделі на чіпі за $10 демонструє, наскільки значного прогресу досягли техніки стиснення ШІ-моделей — і натякає на потенціал використання флеш-пам’яті як багатошарового сховища для ШІ-систем загалом.
Нагадаємо, що захисні обмеження у відкритих LLM можна обійти за 10 хвилин — навіть без специфічних технічних знань.
Головна > Новини > Український програміст першим у світі запустив повноцінну LLM на мікроконтролері за $10
