Ubuntu下docker运行vllm+deepseek
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
Python内容推荐
Chinese edition of *Learn AI-Assisted Python Programming* |《AI.zip
《AI 研发提效:构建 AI 辅助编码助手》 —— 介绍如何 DIY 一个端到端(从 IDE 插件、模型选型、数据集构建到模型微调)的 AI 辅助编程工具,类似于 GitHub Copilot、JetBrains AI Assistant、AutoDev 等。
vLLM V1引擎部署参数速查表(4种OOM排障+参数对照+决策树)
vLLM V1引擎迁移部署必备速查表。包含V0 vs V1推荐参数对照、4种CUDA OOM错误→修复映射(warmup OOM/运行时OOM/DeepSeek OOM/TurboQuant OOM)、关键环境变量清单、排障决策树、常用启动命令模板。A4打印放终端旁边,下次OOM不慌。配套文章见CSDN博客。
Claude+Deepseek一键部署脚本
一键部署!避免复杂的安装和环境配置步骤,方便小白极速入门Claude+Deepseek
华为昇腾镜像仓库整理[代码]
本文档由昇腾实战派编写,旨在整理华为昇腾系列模型的Docker镜像仓库地址,为开发者提供统一的镜像索引。内容涵盖了Qwen系列、Deepseek系列和Llama系列等多个模型的推理和训练镜像,包括Vllm-ascend和Mindie等不同版本的镜像地址。文档详细列出了每个模型的镜像名称和对应的拉取命令,确保开发者在不同服务器环境下能够快速获取所需镜像,提升部署效率和环境一致性。
SGLang 部署避坑速查表(五大崩溃修复+安全参数+环境检查清单)
SGLang + DeepSeek-V3 部署必备速查表。包含DP Attention OOM、flashinfer编译失败、NCCL SIGSEGV、PD Disaggregation崩溃、显存检查失败五大崩溃→修复映射、部署前检查清单、关键环境变量、安全启动参数模板(单节点/多节点/Docker)、vLLM V1 vs SGLang对比。A4打印放终端旁边。配套文章见CSDN博客。
DeepSeek-R1部署指南[项目源码]
本文详细介绍了如何在Ubuntu 22.04.4 LTS系统上部署DeepSeek-R1-14b模型,包括原始模型和q8量化模型的下载与安装步骤。首先通过modelscope下载模型,然后安装vllm并配置相关参数,如GPU数量、显存利用率等。接着,文章指导如何通过命令行测试模型是否正常运行。最后,介绍了使用Docker部署Open WebUI的方法,包括拉取镜像、运行容器以及配置外部连接等步骤。整个过程涵盖了从环境搭建到模型测试的完整流程,适合需要本地部署DeepSeek-R1模型的开发者参考。
vLLM本地离线测试[源码]
本文档详细记录了在离线环境的NVIDIA H200 Tensor Core GPU服务器上,使用vLLM框架部署大规模语言模型DeepSeek-R1-0528(671B满血版)并通过官方benchmarks测试工具进行基准测试的完整流程。硬件环境包括DELL XE9680服务器、8张Nvidia H200显卡(140G显存)、1.96TB内存和Ubuntu22.04.5 LTS操作系统。软件环境涉及nvidia-driver-570、docker、vllm/vllm-openai等工具的安装与配置。部署过程包括Docker镜像拉取、容器启动、Conda环境安装及vLLM项目下载与运行。测试命令详细列出了各项参数,如随机输入输出长度、请求数量、请求速率等,以模拟真实场景并压满硬件性能。
PVE显卡直通与vLLM部署[项目源码]
本文详细介绍了在PVE虚拟化环境中实现Nvidia显卡直通的具体步骤,包括修改grub配置、更新内核头文件、设置PCIe直通等关键操作。随后指导在Ubuntu系统中安装Nvidia驱动、CUDA和cuDNN工具包,并配置Nvidia容器工具包以支持Docker。最后重点讲解了使用vLLM框架部署DeepSeek Llama 32B和QWQ大语言模型的方法,涵盖uv和docker两种部署方式,以及模型服务的各项参数配置。文章还提供了Ubuntu系统扩容、SMB挂载等实用技巧,为AI模型部署提供了完整的解决方案。
基于 FastAPI 和 DeepSeek-V3 的 AI 小说分析器.zip
AIWriteX - 微信公众号全自动AI工具:全网热搜舆情聚合+趋势分析+爆款选题+文章采集+一键生成排版发布 | AI自动配图 | 去AI味、过朱雀检测 | 支持小红书/百家号/头条等多平台 | 洗稿润色支持多账号 | 专家赛道 | 手机控制 | 小说连载 | 爆文10…
深度剖析:基于 8xH100 吞吐量基准,探秘 DeepSeek-V3 与 R1 671B 的强大实力
资源下载链接为: https://pan.xunlei.com/s/VOYuII7ZQtNki3Efvl5kRW3CA1?pwd=9hty 本文为在单台8xH100 GPU机器部署DeepSeek V3/R1 671B模型提供全面指南,含多参数配置下的性能吞吐量基准,助力用户了解部署流程与硬件环境服务功能。 测试机器硬件:8×NVIDIA H100 SXM5 GPU、104核Intel Xeon Platinum 8470 CPU、1024GB DDR5 RAM、100 Gbps以太网;软件栈:vLLM 0.7.3、Docker、NVIDIA容器运行时;模型:认知计算/DeepSeek-V3-AWQ、认知计算/DeepSeek-R1-AWQ。 选4位AWQ量化模型,因FP8部署全尺寸671B模型需约685GB VRAM,8xH100仅640GB不足;AWQ将671B参数从8位量化到4位,加FP16存储的37B激活参数,共耗约400GB VRAM,满足部署且留缓存空间。 先决条件:安装Ubuntu 22.04、NVIDIA驱动、Docker及NVIDIA容器运行时(可参考官方文档或用提供的脚本)。设置vLLM环境需导航至对应目录,创建文件配置Hugging Face令牌等环境变量,再执行命令启动服务器(可自定义参数),基准测试按说明运行命令,详情见benchmarks Utils。 并发1-5时,单请求令牌输出吞吐量约33 tokens/s;并发1-200时,100并发达峰值,总令牌吞吐量约3000、输出约620 tokens/s,超100并发任务易挂起。 高并发未必性能好:输出令牌吞吐量增长远低于输入,输出效率难提升,还会均匀分布响应延迟。如要求ITL≤50ms,15并发时延迟接近限制;放宽到200ms,单节点可保合理并发与吞吐量。TTFT和TTLT受并发影响大,8并发时T
Ollama本地大模型指南[源码]
本文详细介绍了Ollama作为本地大模型的“平替神器”,从入门到实战的全面指南。Ollama的设计理念类似于Docker,用户只需一句命令即可在本地运行大模型,无需复杂的环境配置。文章涵盖了Ollama的安装方法、支持的模型类型(如Llama3、Qwen、DeepSeek等)、Python API调用方式以及如何自定义模型(Modelfile)。此外,还提供了三分钟安装与运行方法(Windows/Mac/Linux)、一行命令拉取并启动本地模型的技巧,以及Python如何调用Ollama进行推理的示例代码。对于进阶用户,文章还介绍了如何通过Modelfile对模型进行微调,使其更符合特定需求。
产业园区如何提升科技创新服务能力?.docx
科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新与产业创新智能化发展。
产业园区如何打造一站式科技创新服务平台?.docx
科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新与产业创新智能化发展。
高校科研成果如何精准对接产业需求?.docx
科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新与产业创新智能化发展。
ASP.NET毕业设计含文档和代码ASP考试成绩分析系统的设计与实现(源代码+论文)
ASP.NET毕业设计含文档和代码ASP考试成绩分析系统的设计与实现(源代码+论文)
GPT-6 Astra:99.9% 的分数,和一条会停掉你任务的 API
包含三段: 1. `demo_saturation()` 基准饱和分析。把百分比换算成答错的题目数,并用两比例检验算出区分两档分数需要多少样本。 2. `demo_cost()` 真实账单计算器。实现了 Astra 的 272K 阈值规则和两家不同的缓存费率,输入你自己的 token 分布就能出数。 3. `demo_monitorability()` 可监控性模型。量化 recurrent depth 的压缩比如何影响监控器的漏检率。
国有企业如何降低科技创新平台建设成本?.docx
国有企业如何降低科技创新平台建设成本?
copilot-sdk(Java)
「copilot-sdk(Java)」是开发工具/插件(Java)。项目简介:Multi-platform SDK for integrating GitHub Copilot Agent into apps and services可直接使用,适合日常开发提效与学习借鉴。
国央企如何构建高效的技术创新支撑体系?.docx
国央企如何构建高效的技术创新支撑体系?
librdkafka Windows 包(可直接使用)
librdkafka/win ├─ bin/ # 全部运行时dll + pdb调试符号 + plugins插件目录 ├─ include/ # 头文件 rdkafka.h └─ lib/ # .lib静态导入库(链接阶段使用)
最新推荐



