Xorbits Inference (Xinference) è una libreria potente e versatile per modelli di linguaggio, riconoscimento vocale e modelli multimodali. Con Xinference puoi distribuire il tuo modello o modelli integrati di ultima generazione con un solo comando e servirli come servizio. Ricercatori, sviluppatori e data scientist possono sfruttare appieno le capacità dei moderni modelli di IA.
- Xinference 3.0.0 è disponibile con note di migrazione e modifiche incompatibili: Note di rilascio
- Deploy nativo per agenti: Xinference si integra con Xagent fornendo pianificazione dinamica, utilizzo di tool e inferenze multi-step autonome, superando i limiti delle pipeline statiche.
- Batching automatico: più richieste concorrenti vengono raggruppate automaticamente per aumentare significativamente il throughput. : #4197
- Xllamacpp: nuove binding Python per llama.cpp, mantenute dal team Xinference, che supportano il batching continuo e sono più adatte alla produzione. : #2997
- Inferenza distribuita: i modelli possono essere eseguiti attraverso più worker: #2877
- Miglioramenti per vLLM: condivisione del KV-cache tra più repliche: #2732
- Supporto integrato per MiniCPM5-2B : #5506
- Supporto integrato per la serie Fish Audio (S1-mini, S2-Pro) : #5490
- Supporto integrato per MonkeyOCR : #5475
- Supporto integrato per dots.ocr : #5468
- Supporto integrato per la serie JoyAI per la modifica delle immagini (Edit, Edit Plus) : #5458
- Supporto integrato per Breeze-TTS-2 : #5437
- Supporto integrato per la serie WeMM-Embedding (2B, 4B, 9B) : #5439
- Supporto integrato per NaviDC-OCR : #5431
- Supporto integrato per Kimi-K3 : #5417
- Supporto integrato per i modelli world (Matrix-Game-3.0-5B, HY-WorldPlay-5B, Astra) : #5414
- Supporto integrato per la serie Krea 2 (Raw, Turbo) : #5419
- Supporto integrato per ACE-Step 1.5 : #5413
- Supporto integrato per la serie Ornith 1.5 (35B-A3B, 397B) : #5406, #5405
- Supporto integrato per GLM-5.2 : #5404
- Supporto integrato per GLM-Image : #5394
- Supporto integrato per la serie HiDream-O1 (Image, Image-Dev, Image-Dev-2604) : #5370
- Supporto integrato per SenseNova-U1.5-8B-MoT : #5369
- Supporto integrato per Ideogram4 : #5367
- Supporto integrato per DeepSeek-V4-Flash-0731 : #5371
- Supporto integrato per FireRedTTS3 : #5352
- Supporto integrato per MiniMax-H3 Lightning LoRA : #5338
- Supporto integrato per MiniMax-Music3 : #5345
- Supporto integrato per la serie Qwen3.8 (27B, 2.4T-A95B) : #5337, #5339
- Supporto integrato per jina-reranker-m0 : #5327
- Xagent: piattaforma enterprise per agenti con pianificazione, memoria e integrazione di tool.
- Dify: piattaforma LLMOps per costruire rapidamente applicazioni con visualizzazione e controllo.
- FastGPT: piattaforma di conoscenza basata su LLM per l'elaborazione dei dati e le chiamate ai modelli.
- RAGFlow: motore RAG open-source per una comprensione profonda dei documenti.
- MaxKB: assistente open-source per basi di conoscenza con integrazione RAG.
🌟 Deploy di modelli semplificato: semplifica l'esposizione di LLM, modelli di riconoscimento vocale e modelli multimodali. I modelli di sperimentazione e produzione possono essere configurati e distribuiti con un unico comando.
⚡️ Modelli all'avanguardia facilmente accessibili: prova i modelli integrati con un solo comando. Xinference offre accesso a modelli open source di ultima generazione.
🖥 Supporto per hardware eterogeneo: sfrutta GPU e CPU in modo efficiente (es. tramite ggml) per accelerare l'inferenza.
⚙️ API e interfacce flessibili: API RESTful compatibile OpenAI (incluso Function Calling), RPC, CLI, Web UI, ecc.
🌐 Deploy distribuito: facilita la distribuzione dell'inferenza su più dispositivi e macchine.
🔌 Integrazioni di terze parti: integrazione con LangChain, [LlamaIndex], [Dify], [Chatbox], ecc.
| Funzionalità | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| API RESTful compatibile OpenAI | ✅ | ✅ | ✅ | ✅ |
| Integrazione vLLM | ✅ | ✅ | ✅ | ✅ |
| Diversi motori di inferenza (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Diverse piattaforme (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Deploy in cluster multi-nodo | ✅ | ❌ | ❌ | ✅ |
| Modelli immagine (Testo→Immagine) | ✅ | ✅ | ❌ | ❌ |
| Modelli di embedding testo | ✅ | ❌ | ❌ | ❌ |
| Modelli multimodali | ✅ | ❌ | ❌ | ❌ |
| Modelli vocali | ✅ | ❌ | ❌ | ❌ |
| Funzionalità OpenAI (Function Calling) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Segui la guida di avvio per lanciare Xinference localmente. Dettagli nella documentazione: https://inference.readthedocs.io/.
-
Xinference per le aziende Sono disponibili funzionalità enterprise; per richieste contatta: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
Dai una stella a Xinference su GitHub per ricevere aggiornamenti sulle release.
Gli utenti con GPU NVIDIA possono usare l'immagine Docker di Xinference. Verifica che Docker e CUDA siano installati prima dell'uso.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Dopo aver abilitato le GPU nel cluster Kubernetes, installa con:
# Aggiungi repository
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Aggiorna indice e controlla le versioni
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Installa Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Ulteriori opzioni K8s nella documentazione.
Installa Xinference con pip:
pip install "xinference[all]"Avvia un'istanza locale con:
$ xinference-localPoi puoi usare la Web UI, cURL, la CLI o il client Python.
| Piattaforma | Scopo |
|---|---|
| Github Issues | Segnalazione bug e richieste di feature |
| Discord | Collaborazione con altri utenti |
| Telegram | Discussioni con la community |
| Novità e annunci |
Se questo progetto ti è stato utile, citane il lavoro così:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

