Fused mul + multi_add op (#858)

* Adding fused mul+multi_add + CPU implementation * fused mul+multi_add: CUDA * fused mul+multi_add: command line argument to disable it --------- Co-authored-by: Iwan Kawrakow <iwan.kawrakow@gmail.com>
2026-03-10 14:00:08 +00:00 · 2025-10-24 07:40:35 +03:00
parent 856c6da9c1
commit 0549be76e5
15 changed files with 211 additions and 38 deletions
--- a/common/common.cpp
+++ b/common/common.cpp
@@ -1020,6 +1020,10 @@ bool gpt_params_find_arg(int argc, char ** argv, const std::string & arg, gpt_pa
        params.fused_up_gate = false;
        return true;
    }
+    if (arg == "-no-mmad" || arg == "--no-fused-mul-multiadd") {
+        params.fused_mmad = false;
+        return true;
+    }
    if (arg == "-ser" || arg == "--smart-expert-reduction") {
        CHECK_ARG
        auto values = string_split_pairs<int,float>(argv[i], ',');
@@ -1806,6 +1810,7 @@ void gpt_params_print_usage(int /*argc*/, char ** argv, const gpt_params & param
    options.push_back({ "*",           "-fmoe, --fused-moe",            "enable fused MoE (default: %s)", params.fused_moe_up_gate ? "enabled" : "disabled" });
    options.push_back({ "*",           "-ger,  --grouped-expert-routing", "enable grouped expert routing (default: %s)", params.grouped_expert_routing ? "enabled" : "disabled" });
    options.push_back({ "*",           "-no-fug, --no-fused-up-gate",   "disaable fused up-gate (default: %s)", params.fused_up_gate ? "enabled" : "disabled" });
+    options.push_back({ "*",           "-no-mmad, --no-fused-mul-multiadd", "disaable fused mul-multi_add (default: %s)", params.fused_mmad? "enabled" : "disabled" });
    options.push_back({ "*",         "-ser,  --smart-expert-reduction,","experts reduction (default: %d,%g)", params.min_experts, params.thresh_experts});
    options.push_back({ "*",           "-p,    --prompt PROMPT",        "prompt to start generation with\n"
                                                                        "in conversation mode, this will be used as system prompt\n"
@@ -2762,6 +2767,7 @@ struct llama_context_params llama_context_params_from_gpt_params(const gpt_param
    cparams.fused_moe_up_gate = params.fused_moe_up_gate;
    cparams.grouped_expert_routing = params.grouped_expert_routing;
    cparams.fused_up_gate     = params.fused_up_gate;
+    cparams.fused_mmad        = params.fused_mmad;
    cparams.min_experts       = params.min_experts;
    cparams.thresh_experts    = params.thresh_experts;
    cparams.only_active_experts = params.only_active_exps;
@@ -3879,6 +3885,7 @@ void yaml_dump_non_result_info(FILE * stream, const gpt_params & params, const l
    fprintf(stream, "fused_moe: %s # default: false\n", params.fused_moe_up_gate ? "true" : "false");
    fprintf(stream, "grouped_expert_routing: %s # default: false\n", params.grouped_expert_routing ? "true" : "false");
    fprintf(stream, "fused_up_gate: %s # default: true\n", params.fused_up_gate ? "true" : "false");
+    fprintf(stream, "fused_mmad: %s # default: true\n", params.fused_mmad? "true" : "false");
    fprintf(stream, "ser: %d,%g # defaulr: -1,0\n", params.min_experts, params.thresh_experts);
    fprintf(stream, "temp: %f # default: 0.8\n", sparams.temp);