Компіляція моделі.
Огляд
Model Compiler надає інструмент командного рядка LLiMa під назвою llima-compile, який використовується для
компіляції моделей із файлів Hugging Face safetensors, GGUF, або попередньо квантованих
моделей compressed-tensors (GPTQ/AutoRound):
llima-compile [options] <model_path>
Формати вхідних даних для моделі.
LLiMa приймає три шляхи для введення даних у модель. Оберіть один із них, виходячи з наявності контрольних точок, вимог до точності та того, чи є модель LLM або VLM.
| Вхідні дані | Опис. | Коли використовувати. |
|---|---|---|
| Оригінал Hugging Face safetensors | Контрольна точка FP/BF16, яка LLiMa виконує квантування під час компіляції. | Немає точної попередньо квант ованої відповідності, або потрібні оригінальні значення параметрів. |
| Попередньо квантовані Hugging Face safetensors (GPTQ/AutoRound) | Контрольна точка, квантовані ваги якої повторно використовуються LLiMa. | Рекомендується використовувати, коли колекція містить точну відповідність. |
| GGUF | Наявна квантована контрольна точка LLM. | Зручний варіант резервного копіювання LLM; не підтримується для VLM. |
Один лише формат вхідних даних не забезпечує сумісність. Архітектура моделі, її розмір, токенізатор і будь-які мультимодальні компоненти також повинні підтримуватися.
Почніть з SiMa.ai попередньо квантована модель
Перш ніж завантажувати оригінальні ваги Hugging Face або GGUF, перевірте колекцію попередньо квантованих моделей SiMa.ai . Використовуйте точну відповідність для потрібної архітектури, розміру параметрів, варіанту та модальності, якщо така є.
Пункти збору даних залежать від конкретної моделі та попередньо налаштовані.LLiMa compressed-tensors
артефакти, які можна безпосередньо передавати до llima-compileВони дозволяють уникнути додаткового етапу компіляції, який передбачає перетворення чисел із рухомою комою на квантовані значення, і містять інформацію про походження квантування, необхідну для розуміння їхньої точності та структури. Вони є вхідними даними для компілятора, а не скомпільованим кодом. Modalix моделі.
Для індивідуального налаштування існуючої підтримуваної моделі відповідний репозиторій може містити специфічні для цієї моделі дані. quantize.py,
recipe.yamlі versions.txtПерегляньте інформаційну картку моделі для цього репозиторію та використовуйте
документований скрипт, що там наведено; не використовуйте повторно рецепт, який підходить лише для дещо схожої моделі.
hf download simaai/<model-repository> \
--revision <immutable-revision> \
--local-dir <prequantized-model-directory>
llima-compile <prequantized-model-directory> -o <output-directory>