青蛙小白
#Aigc

使用Text Embeddings Inference运行Embeddings模型和Rerank模型

TEI简介 Text Embeddings Inference(TEI)是一个全面的工具包,旨在高效地部署和服务开源文本嵌入模型。它支持对最流行的模型进行高性能提取,包括FlagEmbedding、Ember、GTE和E5。 TEI提供多种功能,旨在优化部署过程并提高整体性能。 简化部署:TEI消除了模型图(model graph)编译步骤,简化了部署过程。 高效资源利用:得益于小的Docker镜像和快速的启动时间,可以实现真正的无服务器功能。 动态批处理:TEI采用基于token的动态批处理,从而在推理过程中优化资源利用。 优化的推理:TEI通过使用优化的Transformers代码来推理,利用Flash Attention、Candle和cuBLASLt。 Safetensors权重加载: TEI加载Safetensors权重以加快启动时间。 生产就绪:TEI支持通过Open Telemetry进行分布式跟踪,并导出Prometheus指标。 支持Metal,可以在Mac上本地执行 Metal

#Wasm

使用LlamaEdge+WasmEdge在本地运行大模型千问2.5

本文将使用LlamaEdge+WasmEdge来在本地部署Qwen2.5-0.5B-Instruct-GGUF。 系统环境 Ubuntu 24.04 (无GPU,将部署为在CPU上推理) 安装WasmEdge 参考“安装和开始使用WasmEdge”。 wasmedge版本信息如下: wasmedge -v wasmedge version 0.14.1 (plugin "wasi_logging") version 0.1.0.0 ~/.wasmedge/lib/../plugin/libwasmedgePluginWasiNN.so (plugin "wasi_nn") version 0.10.1.0 下载LlamaEdge API Sserver LlamaEdge API Server是一个跨平台的可移植 Wasm 应用,可以在不同CPU和GPU设备上运行。

#Aigc

使用vllm单节点多卡分布式部署Qwen2.5-14B-Instruct

实验环境 OS: Ubuntu 24.04 Python: 3.11 GPU: NVIDIA GeForce RTX 4090 (2个) CUDA Version: 12.6 vLLM安装 见“使用pip安装vLLM” 模型下载 预先使用huggingface-cli下载Qwen/Qwen2.5-14B-Instruct。 Qwen2.5-14B-Instruct部署 启动为兼容OpenAI的API服务。 单机双卡设置CUDA_VISIBLE_DEVICES环境变量。 export CUDA_VISIBLE_DEVICES=0,1 设置了HF_HUB_OFFLINE=1将不会向Hugging Face Hub发起任何HTTP调用。加快加载时间,这也特别适合服务器没有外网访问时。