ollama soll wohl schlechtere Performance als llama.cpp haben, wenn man RAM und VRAM kombiniert, aber es gibt viele widersprüchliche Aussagen (und KI-generierte) Artikel die beide miteinander vergleichen.
Selbst getestet habe ich es noch nicht. ollama war am einfachsten für mich aufzusetzen - einfach das Binary (und das AMD rocm-Paket) runterladen, ollama serve eingeben, fertig. Ich benutze ollama mit webstorm als Harness, da kann man das direkt ins KI-Plugin integrieren. Es kann dort wohl auch für Tab Completion genutzt werden, das Feature verwende ich allerdings nicht, da es mehr stört als nutzt.