图片名称

serverless-api/packages:提供开箱即用的大模型推理API服务,降低AI应用开发门槛 | 2026/08/28

行业背景与痛点

AI大模型应用开发阶段,多数中小团队与初创企业面临双重门槛:一方面,大模型部署需要占用大量GPU资源,前期硬件采购或算力租赁成本过高,多数团队无法承担稳定运行大模型推理的固定开销。另一方面,大模型适配、环境配置、高并发扩容、故障运维等工作需要专业的后端开发团队,单纯的算法团队无法独立完成应用上线全流程。

传统大模型API服务多采用包年包月或固定额度的计费模式,对于并发波动大的应用、测试阶段的原型项目来说,成本浪费严重。部分服务仅支持固定厂商算力,无法实现多算力节点的灵活切换,单点故障会直接导致服务不可用。开发者需要一套无需部署、按需付费、兼容多算力与多模型的开箱即用方案,压缩从模型到应用的落地周期。

项目概述

该项目由Gitee AI联合清华大学高性能计算研究所联合研发,属于Gitee AI Serverless API服务的核心支撑代码仓库。项目核心定位为AI开发者提供开箱即用的企业级大模型推理API服务,覆盖从原型验证到生产部署的全流程开发需求,当前已稳定运行一周年,接入了多种国内外领先算力资源。

该项目依托昇腾openMind应用使能套件,联合魔乐社区、OpenI启智社区、GitCode等多方社区构建协同生态,目前已完成多个主流大模型的适配,支持LoRA微调模型接入,后续将持续推进主流模型的昇腾平台适配工作。

技术架构深度分析

项目核心架构基于Serverless无服务器架构设计,所有算力资源与模型实例由平台统一管理,开发者仅需要通过标准HTTP接口调用模型能力,不需要关心底层基础设施的运维。架构设计的核心目标是降低模型与应用之间的耦合性,通过解耦计算资源与业务代码,提升整体资源利用率,降低开发者的使用成本。

技术层面采用GiEngine作为底层性能引擎,负责多算力节点的调度与资源管理,支撑高性能推理与低成本运行的同时实现。架构内置多算力部署支持与故障转移机制,当某一个算力节点出现故障时,服务可以自动切换到其他可用节点,保证业务连续性。权限控制层面采用细粒度的访问令牌机制,每一个令牌可以独立配置调用限额与权限范围,方便企业做内部成本核算与权限管理。

核心模块分为模型接入层、算力调度层、API网关层三个部分:模型接入层负责标准化不同来源、不同架构大模型的推理接口,支持原生开源模型与第三方微调模型快速接入;算力调度层负责根据当前各节点的负载情况、用户选择的算力类型分配推理实例,按实际调用量弹性扩缩容;API网关层负责请求鉴权、流量控制、日志审计与计费统计,对外提供统一的RESTful API接口,符合通用大模型接口调用规范,开发者可以低成本切换现有服务到该平台。

该架构设计的优势在于,弹性扩缩容能力可以适配从低并发原型到高并发生产应用的不同需求,资源按需分配,不会出现资源闲置浪费。解耦模型与算力的设计,也让平台可以持续接入新的模型与新的算力类型,不需要开发者修改调用代码即可使用新的能力,兼容性与可扩展性较强。

核心功能详解

开箱即用大模型推理

该项目已经完成多种主流大模型的部署与适配工作,开发者不需要下载模型文件,不需要配置推理环境,注册账号获取访问令牌之后即可直接调用接口完成推理。该能力适用于快速验证AI产品想法,缩短原型开发周期,不需要算法开发者投入额外精力做部署运维,可直接聚焦业务逻辑开发。

按次计费模式

计费方式采用按实际调用次数结算,不需要预付年卡或月卡费用,也不需要长期占用固定算力资源。开发者可以清晰统计每一次调用的成本,针对测试项目、低并发应用、流量波动大的场景,可大幅降低不必要的成本支出,预算控制更加灵活精准。企业可以根据实际使用量核算AI模块的投入产出比,避免固定成本浪费。

多算力部署支持

项目接入了多种国内外领先算力资源,部分模型支持多种算力部署,可承载更高并发量的推理请求。不同算力可满足不同区域、不同成本要求的部署需求,开发者可以根据自身业务要求选择合适的算力类型,平衡性能与成本。多算力支撑也让项目具备更强的抗风险能力,不会因为单一算力厂商的资源波动影响业务运行。

算力故障自动转移

架构内置故障转移机制,当当前使用的算力节点出现服务不可用的情况时,系统会自动将请求切换至其他可用算力节点,不会中断业务请求。该能力保障了生产环境下的服务可用性,不需要人工介入处理节点故障,降低运维团队的应急响应压力,适合对服务稳定性要求较高的生产级应用。

LoRA微调模型支持

项目除了支持基础预训练大模型之外,还支持开发者接入自己训练的LoRA微调模型,满足垂直领域的定制化推理需求。开发者只需要按照规范上传微调权重,即可获得对应的推理API,不需要重新部署整个大模型,大幅降低定制模型的部署成本。该能力适合针对特定业务场景做模型微调的团队,保留定制能力的同时享受Serverless架构带来的便利。

细粒度访问令牌控制

开发者可以生成多个访问令牌,针对每一个令牌设置调用额度、权限范围与使用场景,方便团队内部做权限划分与成本统计。企业可以为不同项目、不同开发成员分配独立的令牌,实时统计各项目的API调用成本,避免超预算使用。细粒度权限控制也可以降低令牌泄露带来的风险,限制泄露令牌的调用范围与额度。

资源包灵活选购

平台提供两种使用方式,开发者可以购买通用全模型资源包,使用平台接入的所有主流模型,也可以选购指定算力的特定模型资源包,匹配不同的使用需求。灵活的资源包机制,允许开发者根据自己的常用模型选择最具性价比的方案,不需要为不需要的模型能力付费。

Gitee AI推出的Serverless API服务,为AI开发者提供开箱即用的大模型推理API服务,支持多算力部署、按次计费与故障自动转移。该项目降低大模型应用开发的技术门槛与成本,支持主流大模型与LoRA微调模型接入,适合原型开发与中小规模生产应用部署。

项目地址:https://gitee.com/serverless-api/packages
🔍 来源:Gitee

Gitee AI携手无问芯穹:模型+算力,共创本土化AI社区新篇章 目前,您可通过https://ai./1917直接访问调用这三款模型。 目前,您可通过https://ai.gitee.com/serverless-api/packages/1917直接访问调用这三款模型。 Gitee AI 是开源中国于 2023 年推出的针对 本文作者:OSC开源社区

手机扫描二维码访问

微信扫一扫支付
微信logo微信扫一扫,打赏作者吧~
不喜欢3

本文链接:https://5x10.cn/post/490.html

图片名称

猜你喜欢