llama: factor out model loader

2026-05-11 08:30:19 +00:00 · 2025-08-13 12:12:46 +03:00
parent 2ac615507f
commit 6b6d25bfbf
9 changed files with 2309 additions and 2088 deletions
--- a/src/CMakeLists.txt
+++ b/src/CMakeLists.txt
@@ -17,6 +17,8 @@ add_library(llama
            llama-vocab.cpp
            llama-grammar.cpp
            llama-sampling.cpp
+            llama-mmap.cpp
+            llama-model-loader.cpp
            unicode.h
            unicode.cpp
            unicode-data.cpp
--- a/src/llama-arch.h
+++ b/src/llama-arch.h
@@ -0,0 +1,287 @@
+#pragma once
+
+#include <string>
+
+enum llm_arch {
+    LLM_ARCH_LLAMA,
+    LLM_ARCH_LLAMA4,
+    LLM_ARCH_DECI,
+    LLM_ARCH_FALCON,
+    LLM_ARCH_BAICHUAN,
+    LLM_ARCH_GROK,
+    LLM_ARCH_GPT2,
+    LLM_ARCH_GPTJ,
+    LLM_ARCH_GPTNEOX,
+    LLM_ARCH_MPT,
+    LLM_ARCH_STARCODER,
+    LLM_ARCH_REFACT,
+    LLM_ARCH_BERT,
+    LLM_ARCH_NOMIC_BERT,
+    LLM_ARCH_JINA_BERT_V2,
+    LLM_ARCH_BLOOM,
+    LLM_ARCH_STABLELM,
+    LLM_ARCH_QWEN,
+    LLM_ARCH_QWEN2,
+    LLM_ARCH_QWEN2MOE,
+    LLM_ARCH_QWEN3,
+    LLM_ARCH_QWEN3MOE,
+    LLM_ARCH_PHI2,
+    LLM_ARCH_PHI3,
+    LLM_ARCH_PLAMO,
+    LLM_ARCH_CODESHELL,
+    LLM_ARCH_ORION,
+    LLM_ARCH_INTERNLM2,
+    LLM_ARCH_MINICPM,
+    LLM_ARCH_GEMMA,
+    LLM_ARCH_GEMMA2,
+    LLM_ARCH_GEMMA3,
+    LLM_ARCH_STARCODER2,
+    LLM_ARCH_MAMBA,
+    LLM_ARCH_XVERSE,
+    LLM_ARCH_COMMAND_R,
+    LLM_ARCH_DBRX,
+    LLM_ARCH_OLMO,
+    LLM_ARCH_OPENELM,
+    LLM_ARCH_ARCTIC,
+    LLM_ARCH_DEEPSEEK2,
+    LLM_ARCH_CHATGLM,
+    LLM_ARCH_GLM4,
+    LLM_ARCH_GLM4_MOE,
+    LLM_ARCH_BITNET,
+    LLM_ARCH_BITNET_25,
+    LLM_ARCH_BITNET_B158,
+    LLM_ARCH_T5,
+    LLM_ARCH_T5ENCODER,
+    LLM_ARCH_JAIS,
+    LLM_ARCH_GRANITE,
+    LLM_ARCH_GRANITE_MOE,
+    LLM_ARCH_COHERE2,
+    LLM_ARCH_DOTS1,
+    LLM_ARCH_HUNYUAN_MOE,
+    LLM_ARCH_OPENAI_MOE,
+    LLM_ARCH_UNKNOWN,
+};
+
+enum llm_kv {
+    LLM_KV_GENERAL_TYPE,
+    LLM_KV_GENERAL_ARCHITECTURE,
+    LLM_KV_GENERAL_QUANTIZATION_VERSION,
+    LLM_KV_GENERAL_ALIGNMENT,
+    LLM_KV_GENERAL_NAME,
+    LLM_KV_GENERAL_AUTHOR,
+    LLM_KV_GENERAL_VERSION,
+    LLM_KV_GENERAL_URL,
+    LLM_KV_GENERAL_DESCRIPTION,
+    LLM_KV_GENERAL_LICENSE,
+    LLM_KV_GENERAL_SOURCE_URL,
+    LLM_KV_GENERAL_SOURCE_HF_REPO,
+
+    LLM_KV_VOCAB_SIZE,
+    LLM_KV_CONTEXT_LENGTH,
+    LLM_KV_EMBEDDING_LENGTH,
+    LLM_KV_BLOCK_COUNT,
+    LLM_KV_LEADING_DENSE_BLOCK_COUNT,
+    LLM_KV_FEED_FORWARD_LENGTH,
+    LLM_KV_EXPERT_FEED_FORWARD_LENGTH,
+    LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH,
+    LLM_KV_USE_PARALLEL_RESIDUAL,
+    LLM_KV_TENSOR_DATA_LAYOUT,
+    LLM_KV_EXPERT_COUNT,
+    LLM_KV_EXPERT_USED_COUNT,
+    LLM_KV_EXPERT_SHARED_COUNT,
+    LLM_KV_EXPERT_WEIGHTS_SCALE,
+    LLM_KV_EXPERT_WEIGHTS_NORM,
+    LLM_KV_EXPERT_GATING_FUNC,
+    LLM_KV_NEXTN_PREDICT_LAYERS,
+    LLM_KV_POOLING_TYPE,
+    LLM_KV_LOGIT_SCALE,
+    LLM_KV_DECODER_START_TOKEN_ID,
+    LLM_KV_ATTN_LOGIT_SOFTCAPPING,
+    LLM_KV_FINAL_LOGIT_SOFTCAPPING,
+    LLM_KV_SWIN_NORM,
+    LLM_KV_RESCALE_EVERY_N_LAYERS,
+    LLM_KV_TIME_MIX_EXTRA_DIM,
+    LLM_KV_TIME_DECAY_EXTRA_DIM,
+    LLM_KV_RESIDUAL_SCALE,
+    LLM_KV_EMBEDDING_SCALE,
+    LLM_KV_TOKEN_SHIFT_COUNT,
+    LLM_KV_INTERLEAVE_MOE_LAYER_STEP,
+
+    LLM_KV_ATTENTION_HEAD_COUNT,
+    LLM_KV_ATTENTION_HEAD_COUNT_KV,
+    LLM_KV_ATTENTION_MAX_ALIBI_BIAS,
+    LLM_KV_ATTENTION_CLAMP_KQV,
+    LLM_KV_ATTENTION_KEY_LENGTH,
+    LLM_KV_ATTENTION_VALUE_LENGTH,
+    LLM_KV_ATTENTION_LAYERNORM_EPS,
+    LLM_KV_ATTENTION_LAYERNORM_RMS_EPS,
+    LLM_KV_ATTENTION_CAUSAL,
+    LLM_KV_ATTENTION_Q_LORA_RANK,
+    LLM_KV_ATTENTION_KV_LORA_RANK,
+    LLM_KV_ATTENTION_RELATIVE_BUCKETS_COUNT,
+    LLM_KV_ATTENTION_SLIDING_WINDOW,
+    LLM_KV_ATTENTION_SCALE,
+
+    LLM_KV_ROPE_DIMENSION_COUNT,
+    LLM_KV_ROPE_FREQ_BASE,
+    LLM_KV_ROPE_SCALE_LINEAR,
+    LLM_KV_ROPE_SCALING_TYPE,
+    LLM_KV_ROPE_SCALING_FACTOR,
+    LLM_KV_ROPE_SCALING_ATTN_FACTOR,
+    LLM_KV_ROPE_SCALING_ORIG_CTX_LEN,
+    LLM_KV_ROPE_SCALING_FINETUNED,
+    LLM_KV_ROPE_SCALING_YARN_LOG_MUL,
+
+    LLM_KV_SPLIT_NO,
+    LLM_KV_SPLIT_COUNT,
+    LLM_KV_SPLIT_TENSORS_COUNT,
+
+    LLM_KV_SSM_INNER_SIZE,
+    LLM_KV_SSM_CONV_KERNEL,
+    LLM_KV_SSM_STATE_SIZE,
+    LLM_KV_SSM_TIME_STEP_RANK,
+
+    LLM_KV_TOKENIZER_MODEL,
+    LLM_KV_TOKENIZER_PRE,
+    LLM_KV_TOKENIZER_LIST,
+    LLM_KV_TOKENIZER_TOKEN_TYPE,
+    LLM_KV_TOKENIZER_TOKEN_TYPE_COUNT,
+    LLM_KV_TOKENIZER_SCORES,
+    LLM_KV_TOKENIZER_MERGES,
+    LLM_KV_TOKENIZER_BOS_ID,
+    LLM_KV_TOKENIZER_EOS_ID,
+    LLM_KV_TOKENIZER_UNK_ID,
+    LLM_KV_TOKENIZER_SEP_ID,
+    LLM_KV_TOKENIZER_PAD_ID,
+    LLM_KV_TOKENIZER_CLS_ID,
+    LLM_KV_TOKENIZER_MASK_ID,
+    LLM_KV_TOKENIZER_ADD_BOS,
+    LLM_KV_TOKENIZER_ADD_EOS,
+    LLM_KV_TOKENIZER_ADD_PREFIX,
+    LLM_KV_TOKENIZER_REMOVE_EXTRA_WS,
+    LLM_KV_TOKENIZER_PRECOMPILED_CHARSMAP,
+    LLM_KV_TOKENIZER_HF_JSON,
+    LLM_KV_TOKENIZER_RWKV,
+    LLM_KV_TOKENIZER_CHAT_TEMPLATE,
+    LLM_KV_TOKENIZER_CHAT_TEMPLATE_N,
+    LLM_KV_TOKENIZER_FIM_PRE_ID,
+    LLM_KV_TOKENIZER_FIM_SUF_ID,
+    LLM_KV_TOKENIZER_FIM_MID_ID,
+    LLM_KV_TOKENIZER_FIM_PAD_ID,
+    LLM_KV_TOKENIZER_FIM_REP_ID,
+    LLM_KV_TOKENIZER_FIM_SEP_ID,
+    LLM_KV_TOKENIZER_PREFIX_ID,
+    LLM_KV_TOKENIZER_SUFFIX_ID,
+    LLM_KV_TOKENIZER_MIDDLE_ID,
+    LLM_KV_TOKENIZER_EOT_ID,
+    LLM_KV_TOKENIZER_EOM_ID,
+
+    LLM_KV_ADAPTER_TYPE,
+    LLM_KV_ADAPTER_LORA_ALPHA,
+};
+
+struct LLM_KV {
+    LLM_KV(llm_arch arch, const char* suffix = nullptr);
+
+    llm_arch arch;
+    const char* suffix;
+    std::string operator()(llm_kv kv) const;
+};
+
+enum llm_tensor {
+    LLM_TENSOR_TOKEN_EMBD,
+    LLM_TENSOR_TOKEN_EMBD_NORM,
+    LLM_TENSOR_TOKEN_TYPES,
+    LLM_TENSOR_POS_EMBD,
+    LLM_TENSOR_OUTPUT,
+    LLM_TENSOR_OUTPUT_NORM,
+    LLM_TENSOR_ROPE_FREQS,
+    LLM_TENSOR_ROPE_FACTORS_LONG,
+    LLM_TENSOR_ROPE_FACTORS_SHORT,
+    LLM_TENSOR_ATTN_Q,
+    LLM_TENSOR_ATTN_K,
+    LLM_TENSOR_ATTN_V,
+    LLM_TENSOR_ATTN_QKV,
+    LLM_TENSOR_ATTN_OUT,
+    LLM_TENSOR_ATTN_NORM,
+    LLM_TENSOR_ATTN_NORM_2,
+    LLM_TENSOR_ATTN_OUT_NORM,
+    LLM_TENSOR_ATTN_POST_NORM,
+    LLM_TENSOR_ATTN_ROT_EMBD,
+    LLM_TENSOR_ATTN_SINKS,
+    LLM_TENSOR_FFN_GATE_INP,
+    LLM_TENSOR_FFN_GATE_INP_SHEXP,
+    LLM_TENSOR_FFN_NORM,
+    LLM_TENSOR_FFN_POST_NORM,
+    LLM_TENSOR_FFN_GATE,
+    LLM_TENSOR_FFN_DOWN,
+    LLM_TENSOR_FFN_UP,
+    LLM_TENSOR_FFN_ACT,
+    LLM_TENSOR_FFN_DOWN_EXP,  // split experts for backward compatibility
+    LLM_TENSOR_FFN_GATE_EXP,
+    LLM_TENSOR_FFN_UP_EXP,
+    LLM_TENSOR_FFN_NORM_EXPS,
+    LLM_TENSOR_FFN_DOWN_EXPS, // merged experts
+    LLM_TENSOR_FFN_GATE_EXPS,
+    LLM_TENSOR_FFN_UP_EXPS,
+    LLM_TENSOR_FFN_DOWN_SHEXP,
+    LLM_TENSOR_FFN_GATE_SHEXP,
+    LLM_TENSOR_FFN_UP_SHEXP,
+    LLM_TENSOR_FFN_EXP_PROBS_B,
+    LLM_TENSOR_ATTN_Q_NORM,
+    LLM_TENSOR_ATTN_K_NORM,
+    LLM_TENSOR_LAYER_OUT_NORM,
+    LLM_TENSOR_SSM_IN,
+    LLM_TENSOR_SSM_CONV1D,
+    LLM_TENSOR_SSM_X,
+    LLM_TENSOR_SSM_DT,
+    LLM_TENSOR_SSM_A,
+    LLM_TENSOR_SSM_D,
+    LLM_TENSOR_SSM_OUT,
+    LLM_TENSOR_ATTN_Q_A,
+    LLM_TENSOR_ATTN_Q_B,
+    LLM_TENSOR_ATTN_KV_A_MQA,
+    LLM_TENSOR_ATTN_KV_B,
+    LLM_TENSOR_ATTN_K_B,
+    LLM_TENSOR_ATTN_V_B,
+    LLM_TENSOR_ATTN_Q_A_NORM,
+    LLM_TENSOR_ATTN_KV_A_NORM,
+    LLM_TENSOR_ATTN_SUB_NORM,
+    LLM_TENSOR_FFN_SUB_NORM,
+    LLM_TENSOR_DEC_ATTN_NORM,
+    LLM_TENSOR_DEC_ATTN_Q,
+    LLM_TENSOR_DEC_ATTN_K,
+    LLM_TENSOR_DEC_ATTN_V,
+    LLM_TENSOR_DEC_ATTN_OUT,
+    LLM_TENSOR_DEC_ATTN_REL_B,
+    LLM_TENSOR_DEC_CROSS_ATTN_NORM,
+    LLM_TENSOR_DEC_CROSS_ATTN_Q,
+    LLM_TENSOR_DEC_CROSS_ATTN_K,
+    LLM_TENSOR_DEC_CROSS_ATTN_V,
+    LLM_TENSOR_DEC_CROSS_ATTN_OUT,
+    LLM_TENSOR_DEC_CROSS_ATTN_REL_B,
+    LLM_TENSOR_DEC_FFN_NORM,
+    LLM_TENSOR_DEC_FFN_GATE,
+    LLM_TENSOR_DEC_FFN_DOWN,
+    LLM_TENSOR_DEC_FFN_UP,
+    LLM_TENSOR_DEC_OUTPUT_NORM,
+    LLM_TENSOR_ENC_ATTN_NORM,
+    LLM_TENSOR_ENC_ATTN_Q,
+    LLM_TENSOR_ENC_ATTN_K,
+    LLM_TENSOR_ENC_ATTN_V,
+    LLM_TENSOR_ENC_ATTN_OUT,
+    LLM_TENSOR_ENC_ATTN_REL_B,
+    LLM_TENSOR_ENC_FFN_NORM,
+    LLM_TENSOR_ENC_FFN_GATE,
+    LLM_TENSOR_ENC_FFN_DOWN,
+    LLM_TENSOR_ENC_FFN_UP,
+    LLM_TENSOR_ENC_OUTPUT_NORM,
+    LLM_TENSOR_NEXTN_EH_PROJ,
+    LLM_TENSOR_NEXTN_EMBED_TOKENS,
+    LLM_TENSOR_NEXTN_ENORM,
+    LLM_TENSOR_NEXTN_HNORM,
+    LLM_TENSOR_NEXTN_SHARED_HEAD_HEAD,
+    LLM_TENSOR_NEXTN_SHARED_HEAD_NORM,
+};
+
+llm_arch llm_arch_from_string(const std::string & name);
--- a/src/llama-impl.h
+++ b/src/llama-impl.h
@@ -10,6 +10,11 @@
 #define LLAMA_API_INTERNAL
 #include "llama.h"
 #include <stdexcept>
+#include <climits>
+#include <cstdarg>
+#include <vector>
+#include <cinttypes>
+#include <cstring>

 #ifdef __GNUC__
 #ifdef __MINGW32__
@@ -166,3 +171,48 @@ struct ring_buffer {
    size_t pos = 0;
    std::vector<T> data;
 };
+
+LLAMA_ATTRIBUTE_FORMAT(1, 2)
+static std::string format(const char * fmt, ...) {
+    va_list ap;
+    va_list ap2;
+    va_start(ap, fmt);
+    va_copy(ap2, ap);
+    int size = vsnprintf(NULL, 0, fmt, ap);
+    GGML_ASSERT(size >= 0 && size < INT_MAX); // NOLINT
+    std::vector<char> buf(size + 1);
+    int size2 = vsnprintf(buf.data(), size + 1, fmt, ap2);
+    GGML_ASSERT(size2 == size);
+    va_end(ap2);
+    va_end(ap);
+    return std::string(buf.data(), size);
+}
+
+static std::string llama_format_tensor_shape(const std::vector<int64_t> & ne) {
+    char buf[256];
+    snprintf(buf, sizeof(buf), "%5" PRId64, ne.at(0));
+    for (size_t i = 1; i < ne.size(); i++) {
+        snprintf(buf + strlen(buf), sizeof(buf) - strlen(buf), ", %5" PRId64, ne.at(i));
+    }
+    return buf;
+}
+
+static std::string llama_format_tensor_shape(const struct ggml_tensor * t) {
+    char buf[256];
+    snprintf(buf, sizeof(buf), "%5" PRId64, t->ne[0]);
+    for (int i = 1; i < GGML_MAX_DIMS; i++) {
+        snprintf(buf + strlen(buf), sizeof(buf) - strlen(buf), ", %5" PRId64, t->ne[i]);
+    }
+    return buf;
+}
+
+template <typename T>
+struct no_init {
+    T value;
+    no_init() { /* do nothing */ }
+};
+
+
+struct gguf_context;
+std::string gguf_kv_to_str(const gguf_context * ctx_gguf, int i);
+
--- a/src/llama-mmap.cpp
+++ b/src/llama-mmap.cpp
@@ -0,0 +1,557 @@
+#include "llama-mmap.h"
+#include "llama-impl.h"
+#include "ggml.h"
+
+#include <stdexcept>
+#include <cstring>
+
+#if defined(_WIN32)
+
+static std::string llama_format_win_err(DWORD err) {
+    LPSTR buf;
+    size_t size = FormatMessageA(FORMAT_MESSAGE_ALLOCATE_BUFFER | FORMAT_MESSAGE_FROM_SYSTEM | FORMAT_MESSAGE_IGNORE_INSERTS,
+                                 NULL, err, MAKELANGID(LANG_NEUTRAL, SUBLANG_DEFAULT), (LPSTR)&buf, 0, NULL);
+    if (!size) {
+        return "FormatMessageA failed";
+    }
+    std::string ret(buf, size);
+    LocalFree(buf);
+    return ret;
+}
+
+std::string llama_file::GetErrorMessageWin32(DWORD error_code) const {
+    std::string ret;
+    LPSTR lpMsgBuf = NULL;
+    DWORD bufLen = FormatMessageA(FORMAT_MESSAGE_ALLOCATE_BUFFER | FORMAT_MESSAGE_FROM_SYSTEM | FORMAT_MESSAGE_IGNORE_INSERTS,
+            NULL, error_code, MAKELANGID(LANG_NEUTRAL, SUBLANG_DEFAULT), (LPSTR)&lpMsgBuf, 0, NULL);
+    if (!bufLen) {
+        ret = format("Win32 error code: %s", error_code);
+    } else {
+        ret = lpMsgBuf;
+        LocalFree(lpMsgBuf);
+    }
+
+    return ret;
+}
+
+llama_file::llama_file(const char * fname, const char * mode) {
+    fp = ggml_fopen(fname, mode);
+    if (fp == NULL) {
+        throw std::runtime_error(format("failed to open %s: %s", fname, strerror(errno)));
+    }
+    fp_win32 = (HANDLE) _get_osfhandle(_fileno(fp));
+    seek(0, SEEK_END);
+    size = tell();
+    seek(0, SEEK_SET);
+}
+
+size_t llama_file::tell() const {
+    // SetFilePointerEx returns the current position when seeking relative 0 bytes
+    LARGE_INTEGER li;
+    li.QuadPart = 0;
+    BOOL ret = SetFilePointerEx(fp_win32, li, &li, FILE_CURRENT);
+    if (!ret) {
+        throw std::runtime_error(format("read error: %s", GetErrorMessageWin32(GetLastError()).c_str()));
+    }
+
+    return li.QuadPart;
+}
+
+void llama_file::seek(size_t offset, int whence) const {
+    // no need to convert SEEK_* to FILE_*. The enums are the same.
+    // Still, keep static asserts to avoid failures in the future.
+    static_assert(SEEK_SET == FILE_BEGIN, "SEEK_SET != FILE_BEGIN");
+    static_assert(SEEK_CUR == FILE_CURRENT, "SEEK_CUR != FILE_CURRENT");
+    static_assert(SEEK_END == FILE_END, "SEEK_END != FILE_END");
+
+    LARGE_INTEGER li;
+    li.QuadPart = offset;
+    BOOL ret = SetFilePointerEx(fp_win32, li, NULL, whence);
+    if (!ret) {
+        throw std::runtime_error(format("read error: %s", GetErrorMessageWin32(GetLastError()).c_str()));
+    }
+}
+
+void llama_file::read_raw(void * ptr, size_t len) const {
+    // On Win32 ReadFile is significant faster than fread which is again significant faster than std::fstream. Thus
+    // use the Win32 API to do file io instead of the C/C++ library functions.
+
+    // There are conditions under which ReadFile cannot read chunks >64MB.
+    // Thus split the operation into smaller chunks if len exceeds this limit.
+    size_t bytes_read = 0;
+    while (bytes_read < len) {
+        size_t chunk_size = std::min<size_t>(len - bytes_read, 64*1024*1024);
+        DWORD chunk_read = 0;
+        BOOL result = ReadFile(fp_win32, reinterpret_cast<char*>(ptr) + bytes_read, chunk_size, &chunk_read, NULL);
+        if (!result) {
+            throw std::runtime_error(format("read error: %s", GetErrorMessageWin32(GetLastError()).c_str()));
+        }
+        if (chunk_read < chunk_size || chunk_read == 0) {
+            throw std::runtime_error("unexpectedly reached end of file");
+        }
+
+        bytes_read += chunk_read;
+    } ;
+}
+
+void llama_file::write_raw(const void * ptr, size_t len) const {
+    // There are conditions under which WriteFile cannot write chunks >64MB.
+    // Thus split the operation into smaller chunks if len exceeds this limit.
+    size_t bytes_written = 0;
+    while (bytes_written < len) {
+        size_t chunk_size = std::min<size_t>(len - bytes_written, 64*1024*1024);
+        DWORD chunk_written = 0;
+        BOOL result = WriteFile(fp_win32, reinterpret_cast<char const*>(ptr) + bytes_written, chunk_size, &chunk_written, NULL);
+        if (!result) {
+            throw std::runtime_error(format("write error: %s", GetErrorMessageWin32(GetLastError()).c_str()));
+        }
+        if (chunk_written < chunk_size || chunk_written == 0) {
+            throw std::runtime_error("unexpectedly failed to write bytes");
+        }
+
+        bytes_written += chunk_written;
+    }
+}
+
+llama_file::~llama_file() {
+    if (fp) {
+        std::fclose(fp);
+    }
+}
+
+#else
+
+llama_file::llama_file(const char * fname, const char * mode) {
+    fp = ggml_fopen(fname, mode);
+    if (fp == NULL) {
+        throw std::runtime_error(format("failed to open %s: %s", fname, strerror(errno)));
+    }
+    seek(0, SEEK_END);
+    size = tell();
+    seek(0, SEEK_SET);
+}
+
+size_t llama_file::tell() const {
+#ifdef _WIN32
+    __int64 ret = _ftelli64(fp);
+#else
+    long ret = std::ftell(fp);
+#endif
+    if (ret == -1) {
+        throw std::runtime_error(format("ftell error: %s", strerror(errno)));
+    }
+
+    return (size_t) ret;
+}
+
+void llama_file::seek(size_t offset, int whence) const {
+#ifdef _WIN32
+    int ret = _fseeki64(fp, (__int64) offset, whence);
+#else
+    int ret = std::fseek(fp, (long) offset, whence);
+#endif
+    if (ret != 0) {
+        throw std::runtime_error(format("seek error: %s", strerror(errno)));
+    }
+}
+
+void llama_file::read_raw(void * ptr, size_t len) const {
+    if (len == 0) {
+        return;
+    }
+    errno = 0;
+    std::size_t ret = std::fread(ptr, len, 1, fp);
+    if (ferror(fp)) {
+        throw std::runtime_error(format("read error: %s", strerror(errno)));
+    }
+    if (ret != 1) {
+        throw std::runtime_error("unexpectedly reached end of file");
+    }
+}
+
+void llama_file::write_raw(const void * ptr, size_t len) const {
+    if (len == 0) {
+        return;
+    }
+    errno = 0;
+    size_t ret = std::fwrite(ptr, len, 1, fp);
+    if (ret != 1) {
+        throw std::runtime_error(format("write error: %s", strerror(errno)));
+    }
+}
+
+llama_file::~llama_file() {
+    if (fp) {
+        std::fclose(fp);
+    }
+}
+#endif
+using llama_files = std::vector<std::unique_ptr<llama_file>>;
+
+#ifdef _POSIX_MAPPED_FILES
+
+llama_mmap::llama_mmap(struct llama_file * file, size_t prefetch, bool numa, [[maybe_unused]] bool use_thp) {
+    size = file->size;
+    int fd = fileno(file->fp);
+    int flags = MAP_SHARED;
+    // prefetch/readahead impairs performance on NUMA systems
+    if (numa)  { prefetch = 0; }
+#ifdef __linux__
+    // advise the kernel to read the file sequentially (increases readahead)
+    if (posix_fadvise(fd, 0, 0, POSIX_FADV_SEQUENTIAL)) {
+        LLAMA_LOG_WARN("warning: posix_fadvise(.., POSIX_FADV_SEQUENTIAL) failed: %s\n",
+                strerror(errno));
+    }
+    if (prefetch) { flags |= MAP_POPULATE; }
+    if (use_thp) {
+        size_t huge = get_default_huge_page_size();
+        auto size = huge*((file->size + huge - 1)/huge);
+        addr = mmap(nullptr, size, PROT_READ | PROT_WRITE, MAP_PRIVATE | MAP_ANONYMOUS | MAP_HUGETLB, -1, 0);
+        if (addr != MAP_FAILED) {
+            printf("%s: using THP with page size %zu MiB ", __func__, huge/(1024*1024));
+            fflush(stdout);
+            size_t tot = 0;
+            while (tot < file->size) {
+                auto n_read = pread(fd, static_cast<char*>(addr) + tot, file->size - tot, tot);
+                if (n_read < 0) throw std::runtime_error(format("Reading into mapped huge pages failed at %zu (%s)", tot, strerror(errno)));
+                printf(".");  fflush(stdout);
+                tot += n_read;
+            }
+            printf(" done\n");
+            mapped_fragments.emplace_back(0, file->size);
+            mapped_page_size = huge;
+            return;
+        }
+        else {
+            fprintf(stderr, "%s: mmap with huge page size %zu MiB failed (%s)\n", __func__, huge/(1024*1024), strerror(errno));
+        }
+    }
+#endif
+    addr = mmap(NULL, file->size, PROT_READ, flags, fd, 0);
+    if (addr == MAP_FAILED) { // NOLINT
+        throw std::runtime_error(format("mmap failed: %s", strerror(errno)));
+    }
+
+    if (prefetch > 0) {
+        // advise the kernel to preload the mapped memory
+        if (posix_madvise(addr, std::min(file->size, prefetch), POSIX_MADV_WILLNEED)) {
+            LLAMA_LOG_WARN("warning: posix_madvise(.., POSIX_MADV_WILLNEED) failed: %s\n",
+                    strerror(errno));
+        }
+    }
+    if (numa) {
+        // advise the kernel not to use readahead
+        // (because the next page might not belong on the same node)
+        if (posix_madvise(addr, file->size, POSIX_MADV_RANDOM)) {
+            LLAMA_LOG_WARN("warning: posix_madvise(.., POSIX_MADV_RANDOM) failed: %s\n",
+                    strerror(errno));
+        }
+    }
+
+    // initialize list of mapped_fragments
+    mapped_fragments.emplace_back(0, file->size);
+}
+
+static void llama_mmap::align_range(size_t * first, size_t * last, size_t page_size) {
+    // align first to the next page
+    size_t offset_in_page = *first & (page_size - 1);
+    size_t offset_to_page = offset_in_page == 0 ? 0 : page_size - offset_in_page;
+    *first += offset_to_page;
+
+    // align last to the previous page
+    *last = *last & ~(page_size - 1);
+
+    if (*last <= *first) {
+        *last = *first;
+    }
+}
+
+// partially unmap the file in the range [first, last)
+void llama_mmap::unmap_fragment(size_t first, size_t last) {
+    // note: this function must not be called multiple times with overlapping ranges
+    // otherwise, there is a risk of invalidating addresses that have been repurposed for other mappings
+    int page_size = mapped_page_size > 0 ? mapped_page_size : sysconf(_SC_PAGESIZE);
+    align_range(&first, &last, page_size);
+    size_t len = last - first;
+
+    if (len == 0) {
+        return;
+    }
+
+    GGML_ASSERT(first % page_size == 0);
+    GGML_ASSERT(last % page_size == 0);
+    GGML_ASSERT(last > first);
+
+    void * next_page_start = (uint8_t *) addr + first;
+
+    // unmap the range
+    if (munmap(next_page_start, len)) {
+        LLAMA_LOG_WARN("warning: munmap failed: %s\n", strerror(errno));
+    }
+
+    // update the list of mapped fragments to avoid unmapping the same range again in the destructor
+    std::vector<std::pair<size_t, size_t>> new_mapped_fragments;
+    for (const auto & frag : mapped_fragments) {
+        if (frag.first < first && frag.second > last) {
+            // the range is in the middle of the fragment, split it
+            new_mapped_fragments.emplace_back(frag.first, first);
+            new_mapped_fragments.emplace_back(last, frag.second);
+        } else if (frag.first < first && frag.second > first) {
+            // the range starts in the middle of the fragment
+            new_mapped_fragments.emplace_back(frag.first, first);
+        } else if (frag.first < last && frag.second > last) {
+            // the range ends in the middle of the fragment
+            new_mapped_fragments.emplace_back(last, frag.second);
+        } else if (frag.first >= first && frag.second <= last) {
+            // the range covers the entire fragment
+        } else {
+            // the range is outside the fragment
+            new_mapped_fragments.push_back(frag);
+        }
+    }
+    mapped_fragments = std::move(new_mapped_fragments);
+}
+
+#ifdef __linux__
+static int llama_mmap::get_default_huge_page_size() {
+    int pg_size = 2048;
+    std::ifstream in("/proc/meminfo");
+    if (in) {
+        std::string line;
+        while (true) {
+            std::getline(in, line);
+            if (in.fail()) break;
+            if (auto pos = line.find("Hugepagesize:"); pos != std::string::npos) {
+                std::istringstream str(line.data() + pos + 13);
+                int aux;
+                str >> aux;
+                if (!str.fail()) pg_size = aux;
+                break;
+            }
+        }
+    }
+    return pg_size * 1024;
+}
+#endif
+
+llama_mmap::~llama_mmap() {
+    for (const auto & frag : mapped_fragments) {
+        if (munmap((char *) addr + frag.first, frag.second - frag.first)) {
+            LLAMA_LOG_WARN("warning: munmap failed: %s\n", strerror(errno));
+        }
+    }
+}
+
+#elif defined(_WIN32)
+
+llama_mmap::llama_mmap(struct llama_file * file, size_t prefetch, bool numa, [[maybe_unused]] bool use_thp) {
+    GGML_UNUSED(numa);
+
+    size = file->size;
+
+    HANDLE hFile = (HANDLE) _get_osfhandle(_fileno(file->fp));
+
+    HANDLE hMapping = CreateFileMappingA(hFile, NULL, PAGE_READONLY, 0, 0, NULL);
+
+    if (hMapping == NULL) {
+        DWORD error = GetLastError();
+        throw std::runtime_error(format("CreateFileMappingA failed: %s", llama_format_win_err(error).c_str()));
+    }
+
+    addr = MapViewOfFile(hMapping, FILE_MAP_READ, 0, 0, 0);
+    DWORD error = GetLastError();
+    CloseHandle(hMapping);
+
+    if (addr == NULL) {
+        throw std::runtime_error(format("MapViewOfFile failed: %s", llama_format_win_err(error).c_str()));
+    }
+
+    if (prefetch > 0) {
+#if _WIN32_WINNT >= 0x602
+        // PrefetchVirtualMemory is only present on Windows 8 and above, so we dynamically load it
+        BOOL (WINAPI *pPrefetchVirtualMemory) (HANDLE, ULONG_PTR, PWIN32_MEMORY_RANGE_ENTRY, ULONG);
+        HMODULE hKernel32 = GetModuleHandleW(L"kernel32.dll");
+
+        // may fail on pre-Windows 8 systems
+        pPrefetchVirtualMemory = reinterpret_cast<decltype(pPrefetchVirtualMemory)> (GetProcAddress(hKernel32, "PrefetchVirtualMemory"));
+
+        if (pPrefetchVirtualMemory) {
+            // advise the kernel to preload the mapped memory
+            WIN32_MEMORY_RANGE_ENTRY range;
+            range.VirtualAddress = addr;
+            range.NumberOfBytes = (SIZE_T) std::min(size, prefetch);
+            if (!pPrefetchVirtualMemory(GetCurrentProcess(), 1, &range, 0)) {
+                LLAMA_LOG_WARN("warning: PrefetchVirtualMemory failed: %s\n",
+                        llama_format_win_err(GetLastError()).c_str());
+            }
+        }
+#else
+        throw std::runtime_error("PrefetchVirtualMemory unavailable");
+#endif
+    }
+}
+
+void llama_mmap::unmap_fragment(size_t first, size_t last) {
+    // not supported
+    GGML_UNUSED(first);
+    GGML_UNUSED(last);
+}
+
+llama_mmap::~llama_mmap() {
+    if (!UnmapViewOfFile(addr)) {
+        LLAMA_LOG_WARN("warning: UnmapViewOfFile failed: %s\n",
+                llama_format_win_err(GetLastError()).c_str());
+    }
+}
+
+#else
+
+llama_mmap::llama_mmap(struct llama_file * file, size_t prefetch, bool numa, bool use_thp) {
+    GGML_UNUSED(file);
+    GGML_UNUSED(prefetch);
+    GGML_UNUSED(numa);
+    GGML_UNUSED(use_thp);
+
+    throw std::runtime_error("mmap not supported");
+}
+
+void llama_mmap::unmap_fragment(size_t first, size_t last) {
+    GGML_UNUSED(first);
+    GGML_UNUSED(last);
+
+    throw std::runtime_error("mmap not supported");
+}
+#endif
+using llama_mmaps = std::vector<std::unique_ptr<llama_mmap>>;
+
+
+void llama_mlock::init(void * ptr) {
+    GGML_ASSERT(addr == NULL && size == 0); // NOLINT
+    addr = ptr;
+}
+
+void llama_mlock::grow_to(size_t target_size) {
+    GGML_ASSERT(addr);
+    if (failed_already) {
+        return;
+    }
+    size_t granularity = lock_granularity();
+    target_size = (target_size + granularity - 1) & ~(granularity - 1);
+    if (target_size > size) {
+        if (raw_lock((uint8_t *) addr + size, target_size - size)) {
+            size = target_size;
+        } else {
+            failed_already = true;
+        }
+    }
+}
+
+#ifdef _POSIX_MEMLOCK_RANGE
+
+static size_t llama_m::lock_granularity() {
+    return (size_t) sysconf(_SC_PAGESIZE);
+}
+
+#ifdef __APPLE__
+    #define MLOCK_SUGGESTION \
+        "Try increasing the sysctl values 'vm.user_wire_limit' and 'vm.global_user_wire_limit' and/or " \
+        "decreasing 'vm.global_no_user_wire_amount'.  Also try increasing RLIMIT_MEMLOCK (ulimit -l).\n"
+#else
+    #define MLOCK_SUGGESTION \
+        "Try increasing RLIMIT_MEMLOCK ('ulimit -l' as root).\n"
+#endif
+
+bool llama_mlock::raw_lock(const void * addr, size_t size) const {
+    if (!mlock(addr, size)) {
+        return true;
+    }
+
+    char* errmsg = std::strerror(errno);
+    bool suggest = (errno == ENOMEM);
+
+    // Check if the resource limit is fine after all
+    struct rlimit lock_limit;
+    if (suggest && getrlimit(RLIMIT_MEMLOCK, &lock_limit)) {
+        suggest = false;
+    }
+    if (suggest && (lock_limit.rlim_max > lock_limit.rlim_cur + size)) {
+        suggest = false;
+    }
+
+    LLAMA_LOG_WARN("warning: failed to mlock %zu-byte buffer (after previously locking %zu bytes): %s\n%s",
+            size, this->size, errmsg, suggest ? MLOCK_SUGGESTION : "");
+    return false;
+}
+
+#undef MLOCK_SUGGESTION
+
+void llama_mlock::raw_unlock(void * addr, size_t size) {
+    if (munlock(addr, size)) {
+        LLAMA_LOG_WARN("warning: failed to munlock buffer: %s\n", std::strerror(errno));
+    }
+}
+
+#elif defined(_WIN32)
+
+size_t llama_mlock::lock_granularity() {
+    SYSTEM_INFO si;
+    GetSystemInfo(&si);
+    return (size_t) si.dwPageSize;
+}
+
+bool llama_mlock::raw_lock(void * ptr, size_t len) const {
+    for (int tries = 1; ; tries++) {
+        if (VirtualLock(ptr, len)) {
+            return true;
+        }
+        if (tries == 2) {
+            LLAMA_LOG_WARN("warning: failed to VirtualLock %zu-byte buffer (after previously locking %zu bytes): %s\n",
+                    len, size, llama_format_win_err(GetLastError()).c_str());
+            return false;
+        }
+
+        // It failed but this was only the first try; increase the working
+        // set size and try again.
+        SIZE_T min_ws_size, max_ws_size;
+        if (!GetProcessWorkingSetSize(GetCurrentProcess(), &min_ws_size, &max_ws_size)) {
+            LLAMA_LOG_WARN("warning: GetProcessWorkingSetSize failed: %s\n",
+                    llama_format_win_err(GetLastError()).c_str());
+            return false;
+        }
+        // Per MSDN: "The maximum number of pages that a process can lock
+        // is equal to the number of pages in its minimum working set minus
+        // a small overhead."
+        // Hopefully a megabyte is enough overhead:
+        size_t increment = len + 1048576;
+        // The minimum must be <= the maximum, so we need to increase both:
+        min_ws_size += increment;
+        max_ws_size += increment;
+        if (!SetProcessWorkingSetSize(GetCurrentProcess(), min_ws_size, max_ws_size)) {
+            LLAMA_LOG_WARN("warning: SetProcessWorkingSetSize failed: %s\n",
+                    llama_format_win_err(GetLastError()).c_str());
+            return false;
+        }
+    }
+}
+
+void llama_mlock::raw_unlock(void * ptr, size_t len) {
+    if (!VirtualUnlock(ptr, len)) {
+        LLAMA_LOG_WARN("warning: failed to VirtualUnlock buffer: %s\n",
+                llama_format_win_err(GetLastError()).c_str());
+    }
+}
+
+#else
+
+size_t llama_mlock::lock_granularity() {
+    return (size_t) 65536;
+}
+
+bool llama_mlock::raw_lock([[maybe_unused]] void * addr, [[maybe_unused]] size_t len) const {
+    LLAMA_LOG_WARN("warning: mlock not supported on this system\n");
+    return false;
+}
+
+void llama_mlock::raw_unlock([[maybe_unused]] void * addr, [[maybe_unused]] size_t len) {}
+
+#endif
--- a/src/llama-mmap.h
+++ b/src/llama-mmap.h
@@ -0,0 +1,175 @@
+#pragma once
+
+#include <cstdio>
+#include <cstddef>
+#include <cstdint>
+#include <vector>
+#include <memory>
+
+#if defined(_WIN32)
+    #define WIN32_LEAN_AND_MEAN
+    #ifndef NOMINMAX
+        #define NOMINMAX
+    #endif
+    #include <windows.h>
+    #ifndef PATH_MAX
+        #define PATH_MAX MAX_PATH
+    #endif
+    #include <io.h>
+#endif
+
+struct llama_file {
+
+#if defined(_WIN32)
+    // use FILE * so we don't have to re-open the file to mmap
+    FILE * fp;
+    HANDLE fp_win32;
+    size_t size;
+
+private:
+    std::string GetErrorMessageWin32(DWORD error_code) const;
+
+public:
+
+    llama_file(const char * fname, const char * mode);
+
+    size_t tell() const;
+
+    void seek(size_t offset, int whence) const;
+
+    void read_raw(void * ptr, size_t len) const;
+
+    uint32_t read_u32() const {
+        uint32_t val;
+        read_raw(&val, sizeof(val));
+        return val;
+    }
+
+    void write_raw(const void * ptr, size_t len) const;
+
+    void write_u32(std::uint32_t val) const {
+        write_raw(&val, sizeof(val));
+    }
+
+    ~llama_file();
+#else
+    // use FILE * so we don't have to re-open the file to mmap
+    FILE * fp;
+    size_t size;
+
+    llama_file(const char * fname, const char * mode);
+
+    size_t tell() const;
+
+    void seek(size_t offset, int whence) const;
+
+    void read_raw(void * ptr, size_t len) const;
+
+    uint32_t read_u32() const {
+        uint32_t ret;
+        read_raw(&ret, sizeof(ret));
+        return ret;
+    }
+
+    void write_raw(const void * ptr, size_t len) const;
+
+    void write_u32(std::uint32_t val) const {
+        write_raw(&val, sizeof(val));
+    }
+
+    ~llama_file();
+#endif
+};
+using llama_files = std::vector<std::unique_ptr<llama_file>>;
+
+struct llama_mmap {
+    void * addr;
+    size_t size;
+    size_t mapped_page_size = 0;
+
+    llama_mmap(const llama_mmap &) = delete;
+
+#ifdef _POSIX_MAPPED_FILES
+    static constexpr bool SUPPORTED = true;
+
+    // list of mapped fragments (first_offset, last_offset)
+    std::vector<std::pair<size_t, size_t>> mapped_fragments;
+
+    llama_mmap(struct llama_file * file, size_t prefetch = (size_t) -1 /* -1 = max value */, bool numa = false, bool use_thp = false);
+
+    static void align_range(size_t * first, size_t * last, size_t page_size) {
+        // align first to the next page
+        size_t offset_in_page = *first & (page_size - 1);
+        size_t offset_to_page = offset_in_page == 0 ? 0 : page_size - offset_in_page;
+        *first += offset_to_page;
+
+        // align last to the previous page
+        *last = *last & ~(page_size - 1);
+
+        if (*last <= *first) {
+            *last = *first;
+        }
+    }
+
+    // partially unmap the file in the range [first, last)
+    void unmap_fragment(size_t first, size_t last);
+
+#ifdef __linux__
+    static int get_default_huge_page_size();
+#endif
+
+    ~llama_mmap();
+#elif defined(_WIN32)
+    static constexpr bool SUPPORTED = true;
+
+    llama_mmap(struct llama_file * file, size_t prefetch = (size_t) -1, bool numa = false, bool use_thp = false);
+
+    void unmap_fragment(size_t first, size_t last);
+
+    ~llama_mmap();
+#else
+    static constexpr bool SUPPORTED = false;
+
+    llama_mmap(struct llama_file * file, size_t prefetch = -1, bool numa = false, bool use_thp = false);
+
+    void unmap_fragment(size_t first, size_t last);
+#endif
+};
+using llama_mmaps = std::vector<std::unique_ptr<llama_mmap>>;
+
+// Represents some region of memory being locked using mlock or VirtualLock;
+// will automatically unlock on destruction.
+struct llama_mlock {
+    void * addr = NULL;
+    size_t size = 0;
+
+    bool failed_already = false;
+
+    llama_mlock() {}
+    llama_mlock(const llama_mlock &) = delete;
+
+    ~llama_mlock() {
+        if (size) {
+            raw_unlock(addr, size);
+        }
+    }
+
+    void init(void * ptr);
+
+    void grow_to(size_t target_size);
+
+    static size_t lock_granularity();
+
+    bool raw_lock(void * ptr, size_t len) const;
+
+    static void raw_unlock(void * ptr, size_t len);
+
+#ifdef _POSIX_MEMLOCK_RANGE
+    static constexpr bool SUPPORTED = true;
+#elif defined(_WIN32)
+    static constexpr bool SUPPORTED = true;
+#else
+    static constexpr bool SUPPORTED = false;
+#endif
+};
+using llama_mlocks = std::vector<std::unique_ptr<llama_mlock>>;
--- a/src/llama-model-loader.cpp
+++ b/src/llama-model-loader.cpp
--- a/src/llama-model-loader.h
+++ b/src/llama-model-loader.h
@@ -0,0 +1,169 @@
+#pragma once
+
+#include "llama.h"
+#include "llama-impl.h"
+#include "llama-mmap.h"
+#include "llama-arch.h"
+
+#include <cstdint>
+#include <cstddef>
+#include <stdexcept>
+#include <unordered_map>
+#include <vector>
+
+enum llama_fver {
+    GGUF_FILE_VERSION_V1 = 1,
+    GGUF_FILE_VERSION_V2 = 2,
+    GGUF_FILE_VERSION_V3 = 3,
+};
+
+static const char * llama_file_version_name(llama_fver version) {
+    switch (version) {
+        case GGUF_FILE_VERSION_V1: return "GGUF V1 (support until nov 2023)";
+        case GGUF_FILE_VERSION_V2: return "GGUF V2";
+        case GGUF_FILE_VERSION_V3: return "GGUF V3 (latest)";
+    }
+
+    return "unknown";
+}
+
+using llama_buf_map = std::unordered_map<uint32_t, ggml_backend_buffer_t>;
+
+struct llama_model_loader {
+    int n_kv      = 0;
+    int n_tensors = 0;
+    int n_created = 0;
+
+    int64_t n_elements = 0;
+    size_t  n_bytes    = 0;
+
+    bool use_mmap = false;
+    bool check_tensors;
+    bool repack_tensors = false;
+    bool use_thp = false;
+
+    llama_files files;
+    llama_ftype ftype;
+    llama_fver  fver;
+
+    llama_mmaps mappings;
+
+    // Holds information on a model weight
+    struct llama_tensor_weight {
+        uint16_t  idx; // source file index
+        size_t   offs; // tensor data offset in the original file
+
+        ggml_tensor * tensor;
+
+        llama_tensor_weight(const llama_file * file, uint16_t idx, const char * name, const struct gguf_context * gguf_ctx, ggml_tensor * tensor) : idx(idx), tensor(tensor) {
+            const int tensor_idx = gguf_find_tensor(gguf_ctx, name);
+            offs = gguf_get_data_offset(gguf_ctx) + gguf_get_tensor_offset(gguf_ctx, tensor_idx);
+
+            if (offs + ggml_nbytes(tensor) < offs || offs + ggml_nbytes(tensor) > file->size) {
+                throw std::runtime_error(format("tensor '%s' data is not within the file bounds, model is corrupted or incomplete", name));
+            }
+        }
+    };
+    std::vector<llama_tensor_weight> weights;
+
+    std::unordered_map<std::string, struct llama_model_kv_override> kv_overrides;
+    const llama_model_tensor_buft_override * tensor_buft_overrides;
+
+    gguf_context * meta = NULL;
+    std::vector<ggml_context *> contexts;
+
+    std::string arch_name;
+    LLM_KV      llm_kv    = LLM_KV(LLM_ARCH_UNKNOWN);
+
+    llama_model_loader(const std::string & fname, bool use_mmap, bool check_tensors, bool repack_tensors, bool use_thp,
+            const llama_model_kv_override * param_overrides_p,
+            const llama_model_tensor_buft_override * param_tensor_buft_overrides_p);
+
+    ~llama_model_loader();
+
+    template<typename T>
+    typename std::enable_if<std::is_integral<T>::value, bool>::type
+    get_arr_n(const std::string & key, T & result, const bool required = true);
+
+    template<typename T>
+    typename std::enable_if<std::is_integral<T>::value, bool>::type
+    get_arr_n(const enum llm_kv kid, T & result, const bool required = true);
+
+    template<typename T>
+    bool get_arr(const std::string & key, std::vector<T> & result, const bool required = true);
+
+    template<typename T, size_t N_MAX>
+    bool get_arr(const std::string & key, std::array<T, N_MAX> & result, const bool required = true);
+
+    template<typename T>
+    bool get_arr(const enum llm_kv kid, T & result, const bool required = true);
+
+    template<typename T>
+    bool get_key(const std::string & key, T & result, const bool required = true);
+
+    template<typename T>
+    bool get_key(const enum llm_kv kid, T & result, const bool required = true);
+
+    // get array of n <= N_MAX elements, or a single element repeated n times
+    template<typename T, size_t N_MAX>
+    bool get_key_or_arr(const std::string & key, std::array<T, N_MAX> & result, uint32_t n, const bool required = true);
+
+    template<typename T>
+    bool get_key_or_arr(const enum llm_kv kid, T & result, uint32_t n, const bool required = true);
+
+    const std::string& get_arch_name() const { return arch_name; }
+
+    enum llm_arch get_arch() const { return llm_kv.arch; }
+
+    const char * get_tensor_name(int i) const;
+
+    const llama_tensor_weight * get_weight(const char * name) const;
+
+    const llama_tensor_weight * get_weight(int i) const {
+        return get_weight(get_tensor_name(i));
+    }
+
+    const llama_tensor_weight & require_weight(const char * name) const;
+
+    struct ggml_tensor * get_tensor_meta(const char * name) const;
+
+    struct ggml_tensor * require_tensor_meta(const char * name) const;
+
+    struct ggml_tensor * get_tensor_meta(int i) const {
+        return get_tensor_meta(get_tensor_name(i));
+    }
+
+    struct ggml_tensor * create_tensor_for(struct ggml_context * ctx, const struct ggml_tensor * cur, bool duplicated);
+
+    const struct ggml_tensor * check_tensor_dims(const std::string & name, const std::vector<int64_t> & ne, bool required) const;
+
+    static const int TENSOR_NOT_REQUIRED = 1 << 0;
+    static const int TENSOR_DUPLICATED   = 1 << 1;
+    static const int TENSOR_SKIP         = 1 << 2;
+
+    struct ggml_tensor * create_tensor(struct ggml_context * ctx, const std::string & name, const std::vector<int64_t> & ne, int flags = 0);
+
+    struct ggml_tensor * create_tensor_as_view(struct ggml_context * ctx, struct ggml_tensor * base,
+            const std::string & name, const std::vector<int64_t> & ne, size_t offset, bool required = true);
+
+    void done_getting_tensors() const;
+
+    void init_mappings(bool prefetch = true, llama_mlocks * mlock_mmaps = nullptr, bool use_thp = false);
+
+    void get_mapping_range(size_t * first, size_t * last, void ** addr, int idx, ggml_context * ctx) const;
+
+    // for backwards compatibility, does not support ggml-backend
+    void load_data_for(struct ggml_tensor * cur) const;
+
+    size_t size_done = 0;
+    size_t size_data = 0;
+    std::vector<std::pair<size_t, size_t>> mmaps_used;
+
+    // Returns false if cancelled by progress_callback
+    bool load_all_data(
+            struct ggml_context * ctx,
+            llama_buf_map & bufs_mmap,
+            llama_mlocks * lmlocks,
+            llama_progress_callback progress_callback,
+            void * progress_callback_user_data);
+};
--- a/src/llama-vocab.cpp
+++ b/src/llama-vocab.cpp
@@ -16,22 +16,6 @@
 // helpers
 //

-LLAMA_ATTRIBUTE_FORMAT(1, 2)
-static std::string format(const char * fmt, ...) {
-    va_list ap;
-    va_list ap2;
-    va_start(ap, fmt);
-    va_copy(ap2, ap);
-    int size = vsnprintf(NULL, 0, fmt, ap);
-    GGML_ASSERT(size >= 0 && size < INT_MAX); // NOLINT
-    std::vector<char> buf(size + 1);
-    int size2 = vsnprintf(buf.data(), size + 1, fmt, ap2);
-    GGML_ASSERT(size2 == size);
-    va_end(ap2);
-    va_end(ap);
-    return std::string(buf.data(), size);
-}
-
 struct naive_trie {
    naive_trie() : has_value(false), value(0) {
    }
--- a/src/llama.cpp
+++ b/src/llama.cpp