针对AMD Ryzen AI MAX+ 395处理器的本地大语言模型优化部署指南。提供63-97 tokens/秒的直接MoE推理性能,支持128GB内存配置。适合AI PC开发者、边缘计算爱好者和AMD硬件用户快速部署高效推理。
本地LLMMoE推理AMD优化
⭐ 43 · Python
用Rust开发的开源AI网关和LLM代理系统。提供统一的API接口管理多个大语言模型,支持MCP协议,适合需要构建企业级AI基础设施、实现模型切换和负载均衡的开发团队。
MCP协议LLM代理AI网关
⭐ 41 · Rust
专为分布式推理工作负载设计的Variant优化自适应调度器。动态优化多变体推理任务分配,提升资源利用率和吞吐量。适合部署大规模LLM推理服务、需要动态负载均衡的AI工程师和平台架构师。
分布式推理自适应调度负载均衡
⭐ 39 · Go
自托管的AI流量管理网关,支持MCP协议、API网关和AI治理功能。为开发者提供统一的AI应用访问控制、流量管理和安全治理能力,适合企业级AI应用部署和API网关场景。
AI网关MCP协议流量管理
⭐ 39 · Rust
AI工具
RAG系统知识库向量数据库
⭐ 38 · Python
AI工具
蛋白质结构PyMOL插件自然语言处理
⭐ 37 · Python
专为Trss Yunzai和NapCat机器人框架设计的开源MCP对话插件。支持本地工具调用、自定义工具集成和MCP服务配置,适合QQ机器人开发者和Yunzai社区用户扩展AI能力。
MCP聊天机器人QQ机器人
⭐ 34 · JavaScript
将量子随机数生成器集成到大模型令牌采样中的工具。支持接入任意熵源,通过gRPC提供分布式推理服务。适合需要高质量随机性的LLM应用开发者和研究人员。
量子随机数LLM采样熵源集成
⭐ 30 · Python
本地代理工具,通过压缩LLM API请求来降低成本,对接口调用无感知。支持Claude等主流模型,适合需要降低API费用的开发者和企业用户。
成本优化API代理Prompt压缩
⭐ 26 · Rust
一个基于Rust原生开发的轻量级高性能LLM推理引擎,专为树莓派及ARM64架构设备优化。它旨在让低功耗硬件能够高效运行大语言模型,非常适合嵌入式开发者和边缘计算爱好者。
LLM推理RustARM64
⭐ 23 · Rust
AI工具
Android应用多模型支持开源
⭐ 23 · Kotlin
macOS系统级AI助手,提供全局悬浮窗口快速调用Gemini、Claude等多个AI服务。支持浏览器集成和聊天功能,让用户在任何应用中无缝使用AI能力,提升工作效率。适合经常需要AI辅助的Mac用户。
macOS应用系统悬浮窗多AI聚合
⭐ 21 · Swift
为Node.js提供llama.cpp的原生绑定,使开发者能在JavaScript环境中直接调用高效的本地大语言模型推理能力。适合构建AI应用、聊天机器人和文本生成服务的Node.js开发者。
Node.jsLLM推理llama.cpp绑定
⭐ 20 · C++
纯C++23实现的Apple Silicon优化Llama推理引擎。专为MacBook/iPad Pro等苹果芯片设备设计,充分利用Metal GPU加速实现高效推理。适合追求极致性能和本地隐私的开发者和AI爱好者。
Apple芯片优化Llama推理GPU加速
⭐ 19 · C++
专业的PyTorch模型到NNEF格式转换工具,支持深度学习模型导出和跨平台推理部署。适合需要模型格式转换、模型优化和推理加速的AI工程师和研究人员使用。
模型转换PyTorchNNEF格式
⭐ 18 · Python
纯Rust实现的CPU推理引擎,专为LiquidAI的LFM2.5-8B模型优化。无需GPU依赖,支持本地离线推理,适合资源受限的开发者和隐私敏感场景部署。
本地推理CPU推理Rust实现
⭐ 16 · Rust
AI工具
API网关协议转换Claude集成
⭐ 15 · Go
AI工具
游戏AI强化学习LLM
⭐ 14 · Python
专业的心电图与自然语言多模态学习框架。集成深度学习技术,实现ECG信号与临床文本的联合训练与评估。适合医疗AI研究人员、生物信号处理开发者及临床决策支持系统开发团队使用。
心电图分析多模态学习生物信号处理
⭐ 14 · Python
一键式桌面应用,集成37家AI服务商(OpenAI、Anthropic等),提供统一的大模型接口管理。适合需要多模型切换、本地部署的开发者和AI应用用户。
LLM网关多模型集成桌面应用
⭐ 14 · Go