стань автором. присоединяйся к сообществу!
сегодня 45

В России с нуля разработали модель искусственного интеллекта на 80 млрд параметров

© t.me
© yandex.ru

Российские разработчики создали с нуля новую языковую модель Alice AI Foundation LLM, которая содержит 80 млрд параметров. Для ее обучения использовали массив данных объемом 18 трлн токенов. При обработке запросов одновременно задействуется около 3 млрд параметров, что позволяет снизить требования к вычислительным ресурсам.Модель станет технологической основой для дальнейшего развития российских сервисов искусственного интеллекта. На ее базе планируют создавать системы, способные решать более сложные задачи с использованием рассуждений, а также самостоятельно выполнять последовательности действий.

[читать статью полностью...]

Кстати, а вы знали, что на «Сделано у нас» статьи публикуют посетители, такие же как и вы? И никакой премодерации, согласований и разрешений! Любой может добавить новость. А лучшие попадут в наш Телеграм @sdelanounas_ru. Подробнее о том как работает наш сайт здесь👈

Источник: t.me

Комментарии 2

Для комментирования необходимо войти на сайт

  • Roman Wyrzykowski Roman Wyrzykowski23.09.26 17:57:58

    Модель содержит 80 млрд параметров, из которых в работе одновременно активны 3 млрд. Она обучена на 18 трлн токенов. «Яндекс» открыл веса модели и выпустил ее в открытый доступ под лицензией Apache 2.0, которая разрешает коммерческое и исследовательское использование.

    Alice AI Foundation LLM является экспериментальной версией будущей единой рассуждающей модели. Она должна стать основой агентных возможностей «Алисы AI», которые позволят пользователям поручать сервису выполнение конкретных действий, сообщили РБК в пресс-службе компании.

    Модель построена на архитектуре Mixture of Experts (MoE). За счет небольшого числа активных параметров она требует меньше вычислительных ресурсов при работе. По данным «Яндекса», модель показывает высокие результаты в задачах на программирование и рассуждение, а также превосходит ряд более крупных открытых моделей в тестах на знание фактов, актуальных для русскоязычных пользователей.

    Для оценки этих возможностей компания разработала два собственных бенчмарка — WikiWebFacts и HardMultiQA. Первый проверяет знания дат, определений, событий и персоналий, второй охватывает более редкие области, включая медицину, право, IT и искусство. Оба набора заданий «Яндекс» также опубликовал в открытом доступе вместе с эталонными ответами и протоколом оценки.

    При обучении модели инженеры оптимизировали процесс передачи данных между видеокартами, что позволило примерно вдвое ускорить отдельные этапы обучения. Кроме того, каскад классификаторов помог в десятки раз сократить объем вычислений при отборе обучающих данных.
    [ссылки отключены]