图片名称

LiteLLM:统一大语言模型调用格式的开源AI网关 | 2026/08/27

背景与痛点

大语言模型领域快速发展,不同厂商推出的模型拥有不同的调用格式、鉴权方式和响应结构。开发团队接入新模型时,需要针对每个模型单独适配SDK,修改调用逻辑,处理不同的错误格式。当业务需要在不同模型之间切换,或者同时调用多个厂商的模型时,适配成本会呈线性增长。

企业级场景下,多模型统一管理的需求更为突出。团队需要统一管控密钥、统计调用量、监控请求延迟、设置速率限制,这些通用能力如果每个模型单独实现,会产生大量重复代码。同时,自托管部署的需求越来越普遍,企业希望将流量控制在自身网络环境内,避免敏感数据经过第三方服务。

该项目针对这些问题提供了一套完整的解决方案,通过统一的调用格式抽象,让所有大语言模型的调用逻辑保持一致,同时提供开箱即用的企业级网关能力,降低了多模型接入和管理的复杂度。

项目概述

该项目由BerriAI团队开发,是一个开源的AI网关项目。核心定位是为超过100种大语言模型提供统一的OpenAI格式调用入口,支持私有化部署,满足企业级生产环境的使用要求。

项目提供两种使用方式:Python库形式可以直接集成到业务代码中,快速完成多模型调用适配;独立代理服务器形式可以单独部署,作为所有大语言模型请求的统一入口,提供统一管控能力。

技术架构深度分析

整体架构设计

项目采用分层架构设计,最上层是暴露给用户的统一API层,兼容OpenAI的所有接口格式,包括聊天补全、补全、嵌入生成等。中间层是模型适配层,每个厂商的模型对应一个独立的适配模块,负责将统一格式的请求转换为对应厂商的请求格式,再将厂商的响应转换回统一格式返回。最下层是基础设施层,提供日志、监控、限流、密钥管理等通用能力。

这样的设计清晰分离了关注点,新增模型只需要在适配层新增对应模块,不会影响上层的API和下层的基础设施。用户侧不需要修改任何调用代码,只需要修改模型标识即可切换不同的模型,极大降低了适配和维护成本。

技术选型

核心代理服务器基于Python开发,选用FastAPI作为Web框架,兼顾开发效率和运行性能,原生支持异步处理,适合高并发的API调用场景。项目同时提供PyPI包分发,方便开发者直接集成到现有Python项目中。支持容器化部署,提供Docker镜像和Terraform配置,适配主流云平台的一键部署流程。

核心模块组织

核心代码分为两个主要部分:litellm Python库负责模型调用的格式转换和基础逻辑处理,proxy部分负责独立网关服务的实现,包含密钥管理、租户隔离、日志监控等企业级功能。每个模型的适配代码遵循统一的接口规范,代码结构清晰,贡献者可以快速参照现有模型完成新模型的适配。

核心功能详解

统一OpenAI格式调用

所有模型都使用与OpenAI完全一致的请求格式和响应格式。开发者只需要熟悉OpenAI的调用方式,就可以接入项目支持的所有模型,不需要学习新的API参数和返回结构。业务代码中仅需要修改模型名称参数,即可完成不同模型之间的切换,不需要重构调用逻辑。

百余种模型原生支持

覆盖几乎所有主流大语言模型厂商,包括闭源商用模型和开源部署模型。支持OpenAI、Anthropic、Google Gemini、Azure OpenAI、通义千问、文心一言等主流服务,也支持本地部署的Llama 2、Mistral、Qwen等开源模型。每个模型的适配由社区维护更新,保持与厂商API更新的同步。

自托管AI网关

可以独立部署为专属AI网关,所有大语言模型请求都经过自身部署的网关转发。满足企业数据合规要求,敏感数据不会流出内部网络,也不需要依赖第三方公共网关服务。支持一键部署到主流云平台,也可以本地容器化部署,启动过程仅需要数分钟。

企业级密钥与访问管控

所有模型的API密钥统一存储在网关侧,业务侧只需要使用网关的密钥即可调用任意模型,不需要在业务代码中管理多个厂商的密钥。支持团队多租户管理,可以为不同团队或不同项目分配独立的访问密钥,设置独立的调用限额。支持速率限制和预算控制,避免意外产生过量调用费用。

统一日志与监控

所有模型请求的日志统一存储,支持查询历史请求内容、响应结果和调用耗时。内置请求量、延迟、错误率等指标监控,可以对接Prometheus等监控系统,方便团队掌握所有模型的调用状态。支持成本统计,按模型、按团队统计调用费用,方便企业做成本分摊和预算管理。

流式响应支持

完全兼容OpenAI的流式响应格式,所有支持流式输出的模型都会返回符合OpenAI规范的流式数据。前端可以直接复用已有的流式展示逻辑,不需要针对不同模型做特殊处理。流式响应的延迟控制与直接调用厂商API保持一致,不会产生明显的额外延迟。

函数调用兼容

对支持函数调用的模型,统一转换为OpenAI格式的函数调用返回结构。业务侧不需要针对不同模型适配不同的工具调用解析逻辑,一套代码可以适配所有支持函数调用的模型。该能力适配当前Agent开发的主流需求,降低了多模型Agent系统的开发复杂度。

开源AI网关,支持百余种大语言模型,统一使用OpenAI格式调用。支持私有化部署,提供企业级密钥管理、监控和访问管控能力,满足多模型统一接入的生产需求。

项目地址:https://github.com/BerriAI/litellm
⭐ Stars:57366
🔍 来源:GitHub

The fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]

手机扫描二维码访问

微信扫一扫支付
微信logo微信扫一扫,打赏作者吧~
不喜欢3

本文链接:https://5x10.cn/post/481.html

图片名称

猜你喜欢