LocalAI: åpen kildekode-alternativet for helt lokal AI

  • LocalAI tilbyr et OpenAI-kompatibelt API for å kjøre LLM-er, bilde, lyd og agenter helt lokalt og uten å være avhengig av skyen.
  • Den modulære arkitekturen laster bare ned nødvendige backend-enheter, oppdager automatisk maskinvaren og støtter CPU, GPU, Metal, Jetson og distribuert akselerasjon.
  • Økosystemet inkluderer LocalAGI, LocalRecall og et oppdatert WebUI med MCP-støtte, agenter med eksterne verktøy og avansert modelladministrasjon.
  • Fellesskapet driver en svært aktiv plan og avledede applikasjoner, som personvernorienterte og lokale AI-chat-mobilklienter for bruk offline.

Lokal KI

Hvis du er interessert i å sette opp din egen AI hjemme eller på serverne dine uten å være avhengig av noen, LocalAI har blitt en av de viktigste referansene i økosystemet med åpen kildekodeDet er ikke bare et annet prosjekt: det er En hel familie med verktøy designet for å tjene som en direkte erstatning for OpenAI API og andre kommersielle plattformermen kjører lokalt, med full kontroll over dataene dine og uten obligatorisk GPU-krav.

Langt fra å bare være en modellserver, har LocalAI utviklet seg til en Komplett agentplattform, semantisk minne, multimodal generering og distribuert distribusjonAlt dette med en modulær arkitektur som tilpasser seg både svært beskjeden maskinvare og avansert infrastruktur med GPU-er, Jetson eller distribuerte klynger.

Hva er LocalAI, og hvorfor snakkes det så mye om det?

LocalAI er et åpen kildekode-prosjekt under MIT-lisensen som fungerer som REST API kompatibel med OpenAI-spesifikasjonen (og lignende tjenester som Anthropic eller Elevenlabs)Men den kjører utelukkende på din egen maskin eller på en lokal infrastruktur. Den vedlikeholdes av Ettore Di Giacinto og et svært aktivt fellesskap, og den har allerede fått titusenvis av stjerner på GitHub, noe som gjenspeiler en enorm interesse for skyfrie AI-løsninger.

Hovedideen er at du kan Bruk klientene, SDK-ene og verktøyene dine som er utviklet for OpenAI API uten å måtte endre kodenBare pek endepunktene mot LocalAI-instansen din. Derfra kan du kjøre LLM-er, generere bilder og lyd, bruke TTS, utføre semantisk søk, objektdeteksjon og mer, alt lokalt, uten å sende data utenfor.

En av de mest slående fordelene er at Du trenger ikke nødvendigvis et GPUMange modeller kan kun kjøre på CPU, noe som åpner døren for å montere den på en NAS, en NUC, en gammel server eller en hvilken som helst maskin med minimale ressurser, og justere størrelsen og kvantiseringen av modellene til maskinvarebegrensningene dine.

Local Stack-familien: LocalAI, LocalAGI og LocalRecall

Etter hvert som prosjektet har vokst, har det blitt til en «familie» av sammenkoblede verktøy som dekker mye mer enn enkel modellinferensI dag består den såkalte «Local Stack» hovedsakelig av tre nøkkelkomponenter som kan fungere sammen eller hver for seg.

På den ene siden er LocalAI fortsatt den sentral søyle som et OpenAI-kompatibelt API for tekst, bilder, lyd og andre modaliteterDen håndterer kommunikasjon med de ulike inferens-backend-ene (llama.cpp, vLLM, transformers, diffusers, osv.) og eksponerer et standardgrensesnitt som støtter chat, fullføringer, bildegenerering, TTS, innebygginger, omrangering og til og med eksperimentelle endepunkter som tekst-til-video.

Ved siden av ham dukker det opp LocalAGI, som fungerer som AI-agentadministrasjonsplattform med avansert støtte for agentverktøy og arbeidsflyterDen fungerer som en forbedret erstatning for OpenAIs Responses API, slik at du kan definere agenter som kan resonnere, planlegge trinn, aktivere eksterne verktøy og koordinere komplekse oppgaver autonomt, men alltid kjøre lokalt.

Det tredje elementet er LocalRecall, utformet som REST API og kunnskapshåndteringssystem med permanent minne for agenterI bunn og grunn tilbyr den det semantiske lagringslaget, vektordatabasen og langsiktig konteksthåndtering, slik at agenter og modeller kan huske informasjon, dokumenter og samtaletilstander over tid uten å måtte være avhengige av eksterne tjenester.

Viktige egenskaper: utover en enkel lokal LLM

En av grunnene til at LocalAI har fått så mye oppmerksomhet er fordi Det er ikke begrenset til å betjene store språkmodellerProsjektet dekker et svært bredt spekter av AI-muligheter, noe som gjør det til en slags «generisk infrastruktur» for selvhostede intelligente applikasjoner.

Innen språkområdet tillater LocalAI kjøre LLM-er som er kompatible med flere modellfamilier (Llama, Gemma, Qwen, Phi, Mistral, SmollVLM og andre), med støtte for modeller i GGUF-format via llama.cpp, eller gjennom backend-systemer som transformers eller vLLM, avhengig av tilgjengelig maskinvare og ytelsesbehov.

Når det gjelder multimodal visjon og generering, tilbyr LocalAI støtte for diffusjonsmodeller, bilderedigering, visjonsspråkmodeller og objektdeteksjon i sanntidDette inkluderer integrasjon med prosjekter som stable-diffusion.cpp, HuggingFace-diffusorer, modeller som FLUX, WAN eller Qwen 3 VL, og et dedikert API for objektdeteksjon støttet av rf-detr, som kan kjøre veldig effektivt selv på CPU.

Lyd er et annet sterkt punkt: LocalAI integreres sanntids tale-, tekst-til-tale- og talegjenkjenningsbackends med kloningVi fant alt fra whisper.cpp og faster-whisper for transkripsjon, til TTS-motorer som Bark, Bark-cpp, Coqui, Kokoro, KittenTTS, Piper, Chatterbox, neutts eller Vibevoice, samt modeller for stemmeaktivitetsdeteksjon (VAD) som silero-vad for å kontrollere når man skal snakke eller kutte stillhet.

Modulær arkitektur: lette binære og on-demand backends

En av de største revolusjonene i prosjektet i det siste har vært overgangen til en fullstendig modulær arkitektur der den viktigste LocalAI-binærfilen er atskilt fra backend-fileneTidligere var «alt-i-ett»-bilder store og inneholdt alle mulige motorer som standard, noe som kompliserte lette utrullinger og oppgraderinger.

Med denne nye filosofien er basis Docker-bildet og LocalAI-binærfilen mye mindre og bare laste ned nødvendige backend-er når det er nødvendigNår du installerer en modell fra galleriet eller via YAML-filer, oppdager LocalAI automatisk maskinvaren din (CPU, NVIDIA, AMD eller Intel GPU) og laster ned den riktige varianten av backend som modellen trenger.

Dessuten, takket være dette designet, nå Du kan administrere backend-systemer uavhengig av et dedikert galleri, selv ved bruk av utviklingsversjoner.Dette betyr at du ikke trenger å vente på en ny LocalAI-utgivelse for å prøve den nyeste llama.cpp-, whisper.cpp- eller diffusers-backend: bare oppdater den komponenten, så vil systemet bruke den på sparket.

En annen praktisk detalj som verdsettes høyt av de som jobber i isolerte miljøer eller med svært spesifikke krav, er muligheten til å laste inn tilpassede backends ved å kopiere binærfilene til en angitt mappeUten å rekompilere hele containere kan du teste optimaliserte bygg, varianter for spesifikke arkitekturer eller oppdaterte bygg av backend-systemer uten å påvirke hele systemet.

Kompatibilitet med flere AI-backends

LocalAI integrerer en virkelig omfattende liste over backend-systemer for å dekke ulike typer modeller og brukstilfeller, med akselerasjonsstøtte skreddersydd for hver maskinvareKjernen i LLM-er dreier seg vanligvis om llama.cpp, vLLM og transformers, men det finnes mange flere.

I den generelle LLM-delen gir llama.cpp Effektiv inferens i C/C++ med støtte for CUDA, ROCm, Intel SYCL, Vulkan, Metal og Pure CPUslik at kvantiserte modeller kan kjøres på maskiner uten GPU-er. vLLM bringer PagedAttention og gjennomstrømningsorienterte optimaliseringer, med akselerasjon for CUDA og ROCm, mens transformers åpner døren til HuggingFaces omfattende samling av modeller på CUDA, ROCm, Intel og CPU.

For lyd kombineres backend-systemer som whisper.cpp og faster-whisper for å Rask og bærbar talegjenkjenning på CPU eller GPU, og et bredt utvalg av TTS-motorer: Bark og Bark-cpp, Coqui, Kokoro, Kitten-TTS, Piper, Chatterbox, neutts og Vibevoice, hver med sin egen balanse mellom kvalitet, latens og maskinvarekrav, alt fra ren CPU til CUDA, ROCm, Metal eller Intel.

Når det gjelder visjon og formidling, støtter prosjektet stablediffusion.cpp som en C/C++-implementering av Stable Diffusionsamt HuggingFaces diffusorbibliotek for nyere modeller for bildegenerering og redigering. Avhengig av backend kan CUDA, ROCm, Intel SYCL, Metal eller bare CPU utnyttes.

Utover LLM-er, lyd og bilder integrerer LocalAI Spesifikke backend-systemer som rfdetr for objektdeteksjon, motorer for omrangering av dokumenter og et lokalt vektorlagerI tillegg integreres den med HuggingFace API for å kombinere lokal og ekstern inferens ved behov. Dette gjør plattformen svært omfattende for å bygge utvidede søkesystemer, dokumentnavigasjonsassistenter eller lokale MLOps-pipelines.

Akselerasjon: Fra CPU-optimalisert til GPU, Metal og Jetson

For å sikre at ingen blir utelatt, tilbyr LocalAI et lag med Svært fleksibel akselerasjon, med konfigurasjoner for nesten alle typer moderne maskinvareHvis du har en NVIDIA GPU, kan du dra nytte av CUDA 12 eller 13 i de fleste kompatible backend-systemer, fra llama.cpp til diffusers eller coqui, og justere antall GPU-lag eller belastningen i henhold til ressursene dine.

Når det gjelder AMD-grafikkort, er LocalAI avhengig av ROCm for å Akselererer viktige backend-programmer som llama.cpp, whisper, vLLM, transformers, diffusers, rerankers og diverse TTSDette er veldig interessant for de som setter opp hjemmelabber med Radeon-kort. For Intel-maskinvare kommer støtten via oneAPI og andre teknologier, som distribuerer akselerasjon i backend-systemer som llama.cpp, whisper, stablediffusion, vLLM, diffusers, rfdetr, rerankers og stemmemotorer som Coqui eller Bark.

Hvis du jobber med en Mac, integreres plattformen med Metal og Apples innebygde MLX- og MLX-VLM-backends, og tilbyr Optimalisert inferens på M1-, M2- og M3+-brikker både for LLM-er og for multimodale modeller, i tillegg til støtte for bark-cpp og andre metallkompatible komponenter.

De har heller ikke glemt innebygde scenarier: det finnes spesifikk støtte for dem. NVIDIA Jetson med CUDA 12 og 13Dette tillater kjøring av llama.cpp, whisper, stablediffusion, diffusers og rfdetr på ARM64-enheter som AGX Orin eller edge computing-plattformer, noe som er veldig nyttig for robotikk, sikkerhet eller smarte IoT-prosjekter.

Og alt dette suppleres selvfølgelig av CPU-optimaliserte kjørbare filer, med støtte for instruksjonssett som AVX, AVX2 og AVX512I tillegg til backend-varianter som whisper.cpp, kompilert spesifikt i henhold til prosessorens kapasitet, unngås "ulovlige instruksjons"-feil på eldre eller lavstrømsmaskiner.

Installasjon: binærfiler, skript, Docker og AIO

På et praktisk nivå har LocalAI-teamet lagt mye arbeid i å sørge for at Å få det i gang burde ikke være en odysseDet finnes flere installasjonsmetoder avhengig av miljø og erfaringsnivå, både for raske tester og mer seriøse implementeringer.

På den ene siden kan du starte med en Installasjonsskript som laster ned riktig binærfil og konfigurerer det grunnleggendeDirekte binærfiler finnes også for diverse skrivebordsplattformer, men på macOS er for eksempel ikke DMG-er signert av Apple, noe som kan føre til at systemet markerer dem som «i karantene» og krever en liten omvei for å åpne dem (teamet opprettholder oppfølgingsproblemer med løsninger og mulige forbedringer).

En annen veldig vanlig måte er å bruke Docker til å distribuere LocalAI som frittstående container, enten for CPU-, GPU- eller AIO-avbildninger med forhåndsnedlastede modellerDu kan velge CPU-bare bilder, kombinerte CPU+GPU-bilder eller alt-i-ett-bilder som inkluderer et første sett med bruksklare modeller, selv om sistnevnte tar opp mer plass, og det har blitt advart om at noen "ekstra" varianter i fremtiden kan bli avskrevet til fordel for det nye backend-administrasjonssystemet.

Når man jobber med Docker, er det viktig å skille mellom docker run, som oppretter og starter en ny containerOg `docker start`, som ganske enkelt starter en eksisterende. Hvis du allerede har startet LocalAI og vil starte den på nytt, er den riktige måten å bruke noe som `docker start -i local-ai` for å unngå duplisering av containere eller konflikter med allerede registrerte navn.

Modelllasting og automatisk backend-deteksjon

Når du har LocalAI oppe og går, er neste trinn Last inn modellene du skal bruke, enten fra det offisielle galleriet eller via YAML-konfigurasjonsfiler.Dette er fasen der logikken bak automatisk maskinvare- og backend-deteksjon kommer inn i bildet.

Når du velger en modell i WebUI eller definerer en i YAML, LocalAI Analyser maskinens muligheter (GPU-type, enten det er NVIDIA, AMD eller Intel, CPU-støtte osv.) og last ned riktig backend. for den modell- og enhetskombinasjonen. På denne måten unngår du å manuelt finne ut hvilken llama.cpp-, diffusers- eller whisper.cpp-binærfil du trenger for ditt spesifikke miljø.

Hvis du trenger mer kontroll, lar YAML-konfigurasjonen deg Juster parametere som kontekststørrelse, antall GPU-lag, mmap-bruk, kvantiseringer eller definisjonen av agentverktøyOg takket være WebUI-oppgraderingen er det nå mulig å redigere all YAML direkte fra det grafiske grensesnittet uten å måtte SSH-e inn i serveren eller redigere filer manuelt.

Redesignet WebUI: Visuell administrasjon av modeller, chat og agenter i LocalAI

Nettgrensesnittet har gjennomgått en større redesign rettet mot avanserte brukere, samtidig som det fortsatt er tilgjengelig for de som bare ønsker å utforske visuelt. Migreringen fra HTML til en kombinasjon av Alpine.js og innebygd JavaScript har forbedret hastighet og flyt betraktelig. erfaringsmessig, spesielt i miljøer med mange konfigurasjoner eller modeller.

Fra dette webgrensesnittet kan du få tilgang chat-grensesnitt, bildegenerering, lyd, modellhåndtering og intern konfigurasjonDet finnes en liste over modeller med fuzzy-søk, slik at selv om du gjør en feil når du skriver (for eksempel «gema» i stedet for «gemma»), vil systemet vise deg de riktige resultatene uten at du må bli gal når du prøver å avgrense det nøyaktige begrepet.

Et av de mest praktiske punktene er at WebUI tillater Vis og rediger den komplette YAML-konfigurasjonen for hver modell Fra nettleseren, uten å forlate programmet. Der kan du endre maksimal kontekst, aktivere eller deaktivere multimodal støtte, justere ytelsesparametere eller definere verktøy og MCP-servere for agenter, alt med umiddelbar effekt når du lagrer endringene.

MCP-agenter og support: AI som bruker verktøy lokalt

I sine nyere versjoner har LocalAI tatt et betydelig sprang ved å innlemme Full støtte for Protocol Context Model (PCM) og avanserte agentfunksjonerDette tillater konstruksjon av agenter som ikke bare svarer på spørsmål, men som også kan bruke eksterne verktøy, planlegge trinn og orkestrere komplekse oppgaver.

MCP-integrasjon er basert på rammeverket utviklet fra LocalAGI og relaterte prosjekter som Cogito, noe som resulterer i en enkel måte å Definer «MCP-servere» som containere eller eksterne tjenester som eksponerer verktøyFor eksempel kan du ha en MCP-server som utfører søk på DuckDuckGo, en annen som spør bedriftens interne API-er, eller en som kjører skript på din lokale maskin.

Fra utviklerens synspunkt er det nok å Konfigurer disse MCP-serverne i modellens YAML, uten å måtte skrive Python-kode eller bruke spesifikke bibliotekerNår den er konfigurert, kan du bruke /mcp/v1/chat/completions-endepunktet, som er kompatibelt med OpenAI API, eller aktivere «MCP Agent Mode» direkte fra chat-nettgrensesnittet, slik at modellen begynner å kalle på verktøy når den anser det nødvendig.

Teamet har også investert innsats i Forbedre robustheten til funksjonskall og håndteringen av JSON-skjemaerDette korrigerer feil og panikkproblemer som kan oppstå når modeller genererte ufullkomne verktøydefinisjoner. Med disse forbedringene blir verktøybruken og agentarbeidsflyten mye mer stabil i produksjonen.

LocalAI-veikart og konstant utvikling av prosjektet

Lokal KI beveger seg veldig raskt, med en offentlig veikart i form av merkede problemer hvor du kan følge de siste oppdateringene og de som er planlagt for de kommende månedene. Veikartet viser en kontinuerlig rekke forbedringer som dekker både nye funksjoner og interne forbedringer.

I de senere årene har følgende blitt lagt til Funksjoner som distribuert inferens, føderert modus, P2P for å kjøre LLM-er over et nettverk, dashbord for å administrere instanssvermer og støtte for nye modeller og backends. (Flux, MLX-Audio, WAN, SANA, Bark.cpp, stablediffusion.cpp, osv.), samt et Reranker API og et integrert objektgjenkjennings-API.

Det har også skjedd milepæler, som for eksempel Migrering av alle backend-filer ut av hovedbinærfilen for å redusere vektAnkomsten av en ny launcher for macOS og Linux, den kontinuerlige forbedringen av WebUI og tillegg av eksperimentelle API-er som tekst-til-video via /v1/videos, som kobler til lokale AI-verktøy som lokal videoredigering, er alle en del av veikartet. Fremtidige planer inkluderer mer dynamisk minnehåndtering, forbedret støtte for flere GPU-er, nye agentintegrasjoner og et utvidet MCP-verktøyøkosystem.

Eksempler på bruk i fellesskapet og mobilappen Lokal AI Chatbot

Ånden bak LocalAI er nært knyttet til fellesskapet, noe som gjenspeiles i skaperens egne innlegg på forum som r/selfhosted eller/LocalLLaMADette forumet er der utviklingen av arkitekturen deles direkte og brukerspørsmål besvares. Mange kommentarer dreier seg om hvordan man kan integrere LocalAI som en privat «hjerne» for automatiseringer og personlige prosjekter.

Et av tilfellene som illustrerer den «helt lokale» tilnærmingen er fremveksten av Mobilapplikasjoner som Local AI Chatbot fra Software Tailor, som tilbyr chat med avanserte modeller direkte på enheten uten internettforbindelseDenne appen lar deg snakke med modeller som DeepSeek R1, Qwen, Mistral, Llama 3 eller Phi helt offline, og dermed bevare 100 % personvern og dra nytte av telefonens maskinvare.

Blant funksjonene er Støtte for flere modeller med rask bytte mellom dem, et design fokusert på effektivt ressursforbruk og et rent grensesnitt for problemfri chatting.Den er rettet mot personvernbevisste brukere, fagfolk som håndterer sensitiv informasjon, folk i områder med dårlig tilkobling og AI-entusiaster som er interessert i å eksperimentere med lokale modeller.

Denne typen løsninger demonstrerer hvordan økosystemet rundt LocalAI og lokal AI går utover hovedserveren, bringer «alt på enheten din»-filosofien til mobiltelefoner, datamaskiner og andre formater, med mål om at alle kan bruke avanserte assistenter uten å være avhengige av eksterne tjenester.

LocalAI-prosjektet og verktøyserien viser hvordan det kan gjøres Å bygge en komplett stabel med privat, utvidbar, modulær og multimodal AI, som er i stand til å dekke alt fra enkel chat til komplekse agenter med minne og verktøy, uten å gi opp friheten til fri programvare eller total kontroll over dataene., og posisjonerer seg som et svært seriøst alternativ for de som ikke ønsker at den kunstige intelligensen i prosjektene deres skal avhenge av tredjeparter.

Agentic AI Foundation
Relatert artikkel:
Agentic AI Foundation: den nye felles fronten for åpen agentisk AI, der Linux Foundation samarbeider.

Legg til som foretrukket kilde