行业痛点
AI应用开发过程中,大模型部署需要占用大量硬件资源,本地部署单张主流大模型就需要数十GB的显存空间,中小团队和个人开发者很难承担对应的硬件成本。同时,不同厂商的AI硬件存在架构差异,模型适配需要投入大量额外研发工作,进一步拉长了开发周期,抬高了创新门槛。
主流大模型API服务大多依赖海外算力与硬件,存在数据安全和供应稳定性风险,国内企业需要更符合自主可控要求的开发方案。传统API服务采用包年包月的计费模式,对于低流量的测试场景或者波动较大的业务需求,会造成不必要的成本浪费。
项目概述
该项目是Gitee AI团队推出的企业级大模型API服务载体,基于Gitee自研推理引擎GiEngine构建,核心定位是为AI开发者提供开箱即用的大模型推理能力,深度适配国内主流国产算力资源,简化AI应用开发全流程。
项目依托openMind应用使能套件,聚合昇腾、天数智芯、沐曦等多家国内顶尖算力厂商资源,联合清华大学高性能计算研究所完成核心技术研发,当前已经覆盖八大类共41款各领域顶尖开源模型,持续完成国产算力适配与模型更新。
技术架构深度分析
项目核心技术底座为Gitee自研推理引擎GiEngine,整体架构采用分层解耦设计,底层实现对不同国产硬件的驱动适配与资源调度,中间层封装模型加载、量化优化、推理请求处理等通用能力,上层通过标准化API接口对外暴露服务,降低调用方的接入复杂度。
技术选型上,核心推理优化能力由清华大学高性能计算研究所联合研发,针对国产硬件的架构特性做了专门的指令集优化,能够充分发挥硬件的并行计算能力。架构设计层面采用Serverless无服务器架构,将推理服务与底层基础设施解耦,实现计算资源的动态调度。该设计的优势在于,可以根据实际请求量弹性扩缩容,避免资源闲置浪费,同时降低不同模型之间的耦合性,新增模型适配时不需要改动整体架构,便于快速完成新模型的接入与更新。
核心模块分为四个部分:硬件适配层负责对接不同厂商的计算卡驱动,封装统一的硬件操作接口;模型管理层负责模型权重加载、量化转换、版本管理,支持LoRA微调模型的热加载;请求调度层负责处理来自客户端的推理请求,实现流量控制与负载均衡;计费结算层负责对每个请求的算力消耗进行统计,实现按次计费的粒度控制。分层模块设计让每个部分可以独立迭代更新,硬件适配层新增厂商支持时,不会影响上层API接口的稳定性,降低了生态扩展的研发成本。
核心功能详解
深度对接国产算力
借助GiEngine推理引擎的兼容性设计,该项目已经完成华为昇腾、天数智芯、沐曦MetaX、曙光智算、燧原科技、壁仞科技等国内主流算力厂商的适配,更多国产算力仍在持续接入中。开发者调用API时不需要关心底层硬件的架构差异,底层会自动完成算力调度与硬件适配,帮助开发者在国产硬件上实现高性能、低成本的AI模型推理。该功能解决了国产硬件适配成本高的问题,降低了开发者使用本土算力的技术门槛。
多类别开源模型覆盖
该项目已经接入八大类共41款各领域的顶尖开源模型,覆盖文本生成、视觉模型、图像生成与处理、自动语音识别、语音合成、特征抽取、代码生成等主流AI应用场景。已经包含智谱GLM系列、多模态GLM-4V-9B、硅基流动SiliconDiff扩散模型等多个热门开源项目的模型,同时支持LoRA微调模型接入。开发者不需要在本地部署模型,直接通过API即可调用对应能力,节省了本地存储与计算资源。
开箱即用API调用
开发者完成账号注册后即可直接调用项目提供的所有API服务,不需要完成服务器配置、模型部署、环境搭建等前期工作。所有API接口遵循统一的调用规范,接入过程仅需要完成简单的身份验证,就可以在应用中集成大模型能力,将AI应用开发的前期准备时间从数天缩短到数小时。该能力将更多精力留给应用业务逻辑开发,减少了基础设施层面的重复工作。
按次计费模式
项目采用按推理请求次数计费的模式,不需要预先购买固定规格的包年包月资源,实际调用多少服务支付多少费用。对于开发者测试验证场景,以及流量波动较大的业务,可以有效控制成本,避免闲置资源的预算浪费。企业可以根据实际业务需求调整使用规模,不需要为了预留算力提前投入大量固定成本,降低了AI项目的试错门槛。
扩散模型高效推理支持
项目集成硅基流动SiliconDiff扩散模型加速库,通过在图片中增减噪声的方式优化模型学习过程,实现AIGC图像生成的高效推理。该加速库具备开箱即用、高效加速、广泛模型支持及无缝集成开发框架等优势,支持动态尺寸输入,确保量化后图像显示效果无损,同时支持复杂工作流与动态形状调用,不需要转换模型格式即可直接使用。该功能为AIGC图像生成类应用提供了高性能的推理能力,适配昇腾云算力联合方案,可以实现AIGC模型的性能提升和生产部署。
LoRA微调模型支持
项目支持开发者接入自定义训练的LoRA微调模型,基于基础大模型完成领域知识微调后,可以直接部署到该项目提供的Serverless服务中,不需要重新适配底层架构。该能力让企业可以基于自身业务需求定制模型能力,同时享受Serverless架构带来的资源弹性与成本优势,满足垂直领域的个性化推理需求。当前已经完成多个主流基础大模型的LoRA适配,后续支持范围将持续扩展。
昇腾生态协同适配
项目联合openMind应用使能套件,整合昇腾生态资源,当前所有上传至魔乐社区的智谱开源模型均可在昇腾算力上无缝运行,后续将陆续适配更多主流模型至昇腾平台。通过社区活动推广,帮助开发者直观了解并充分利用昇腾算力的优势,实现多维度协同构筑原生AI生态,全流程支撑开发者完成应用创新,助力伙伴实现商业闭环。
项目地址:https://gitee.com/serverless-api/packages
🔍 来源:Gitee
Gitee AI携手无问芯穹:模型+算力,共创本土化AI社区新篇章 目前,您可通过https://ai. /1917直接访问调用这三款模型。 目 前,您可通过https://ai.gitee.com/serverless-api/packages/1 917直接访问调用这三款模型。 Gitee AI 是开源中国于 2023 年推出的针对 AI 应用场景的 本文作者:OSC开源社区

微信扫一扫,打赏作者吧~


