OSAMAOsama
a desktop studio for llama.cpp and mlx
The full llama.cpp toolbox as a proper desktop app — install the engine, pull GGUF models, chat, serve an OpenAI-compatible API, quantize and benchmark. On Apple silicon it runs MLX too. No terminal required.
$llama-server— openai-compatible endpoint, no cloudok
$llama-quantize— make your own gguf quantsok
$llama-bench— tokens/sec, measured locallyok
$llama-mtmd-cli— vision & audio, off the gridok
000102030405060708091011121314151616tools online
llama-serverllama-clillama-quantizellama-imatrixllama-benchllama-batched-benchllama-perplexityllama-gguf-splitllama-tokenizellama-fit-paramsllama-mtmd-clillama-completionllama-ttsllama-export-loraggml-rpc-serverllama-serverllama-clillama-quantizellama-imatrixllama-benchllama-batched-benchllama-perplexityllama-gguf-splitllama-tokenizellama-fit-paramsllama-mtmd-clillama-completionllama-ttsllama-export-loraggml-rpc-server