RedPajama — open source LLaMa

Группа исследователей из разных организаций и университетов (Together, ontocord.ai, ds3lab.inf.ethz.ch, crfm.stanford.edu, hazyresearch.stanford.edu, mila.quebec) работает над созданием open source альтернативы модели LLaMa и уже опубликовали датасет, релевантный использованному для создания последней.

Несвободная но хорошо сбалансированная LLaMa использовалась в качестве основы для таких проектов как Alpaca, Vicuna и Koala. В других известных проектах (Dolly, Dolly v2, gpt4all) в качестве основы для файнтюнинга использовались свободные, но достаточно старые по современным меркам модели серий gpt-j и gpt-neo.

Следующим шагом будет создание самой модели, что потребует серьёзных вычислительных мощностей. Но с учётом всеобщего интереса к этой теме, это лишь вопрос пары тройки недель.

Источник: https://www.together.xyz/blog/redpajama

@bugman
18.04.2023 03:25 UTC
Первоисточник

Комментарии

@Guul
18.04.2023 04:36 UTC
+1

Иронично, что в PR лламы на изменение лицензии люди отметили, что ллама была тренирована как раз чтобы эти серьёзные вычислительные мощности не приходилось тратить

From section 6. of your own paper on LLaMA: “The training of our models have consumed a massive quantity of energy, responsible for the emission of carbon dioxide. […] This means that developing these models would have cost around 2,638 MWh under our assumptions, and a total emission of 1,015 tCO2eq. We hope that releasing these models will help to reduce future carbon emission since the training is already done, and some of the models are relatively small and can be run on a single GPU.”

@bugman
18.04.2023 08:22 UTC
0

Можно ссылочку? Сходу не нашёл, что там за история изменения лицензии

@slonoten
18.04.2023 05:06 UTC
+2

Собрать открытый датасет не проблема. Найти железо для обучения не имея бюджета будет сложнее.

@MountainGoat
18.04.2023 07:21 UTC
0

Та же фигня. Сижу на отличном датасете и жду, пока головы более лысые умные, чем моя, упростят алгоритм.

@bugman
18.04.2023 08:25 UTC
+2

Собрать открытый датасет пристойного качества, который можно использовать для создания продукта под лицензией Apache 2 - это вполне себе задача. Вот железо найти, как раз не проблема. Оно уже в проекте есть, судя по тому, что они сами пишут