gguf.txt
| 1 | # 1. Конвертация в bf16 (как договорились) |
| 2 | python convert_hf_to_gguf.py /mnt/nfs_share/JiRackUlrta_1 \ |
| 3 | --outfile /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf --outtype bf16 |
| 4 | |
| 5 | # 2. Сборка llama-quantize (один раз) |
| 6 | cd /mnt/nfs_share/llama.cpp |
| 7 | cmake -B build |
| 8 | cmake --build build -j |
| 9 | |
| 10 | # 3. Квантование в Q4_K_M |
| 11 | ./build/bin/llama-quantize \ |
| 12 | /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.gguf \ |
| 13 | /mnt/nfs_share/JiRackUlrta_1/jirack_1p5b.Q4_K_M.gguf \ |
| 14 | Q4_K_M |
| 15 | |