Việc sở hữu một hệ thống Cloud GPU Server mạnh mẽ từ các đơn vị như Adtech mới chỉ là bước đầu tiên. Để thực sự bắt tay vào huấn luyện các mô hình học máy (Machine Learning), bạn cần một môi trường làm việc chuẩn hóa, ổn định và tối ưu hóa hiệu suất phần cứng.
Bài viết này sẽ hướng dẫn chi tiết cách thiết lập môi trường cho hai Framework AI phổ biến nhất hiện nay là PyTorch và TensorFlow trên hệ điều hành Ubuntu (phổ biến nhất cho Server), giúp bạn tận dụng tối đa sức mạnh của các dòng card NVIDIA như A100 hay RTX 4090.
1. Chuẩn bị trước khi cài đặt
Trước khi bắt đầu, hãy đảm bảo Cloud GPU Server của bạn đã đáp ứng các yêu cầu cơ bản sau:
Hệ điều hành: Ubuntu 20.04 LTS hoặc 22.04 LTS (Khuyên dùng vì tính ổn định).
Quyền truy cập: Quyền Root hoặc Sudo qua SSH.
Driver NVIDIA: Đã được cài đặt bản mới nhất phù hợp với phần cứng.
Lưu ý tại Adtech: Khi thuê GPU Server tại Adtech, bạn có thể yêu cầu kỹ thuật viên cài đặt sẵn Driver và CUDA để tiết kiệm thời gian, hoặc tự cài đặt theo các bước dưới đây để tùy chỉnh sâu hơn.

2. Bước 1: Cài đặt NVIDIA Driver và CUDA Toolkit
Đây là bước quan trọng nhất. Nếu không có Driver và CUDA, các Framework AI sẽ không thể giao tiếp với lõi GPU.
2.1. Cài đặt NVIDIA Driver
Cập nhật hệ thống và kiểm tra các Driver khả dụng:
Bash
sudo apt update && sudo apt upgrade -y
ubuntu-drivers devices
Chọn phiên bản Driver phù hợp (ví dụ bản 535) và cài đặt:
Bash
sudo apt install nvidia-driver-535 -y
Sau khi cài đặt, hãy khởi động lại máy chủ và kiểm tra bằng lệnh: nvidia-smi. Nếu hiện ra bảng thông số GPU, bạn đã thành công.

2.2. Cài đặt CUDA Toolkit
Truy cập trang chủ NVIDIA để lấy link tải bản CUDA phù hợp (thường là CUDA 11.8 hoặc 12.x cho các dòng GPU mới).
Bash
wget https://developer.download.nvidia.com/compute/cuda/12.1.0/local_installers/cuda_12.1.0_530.30.02_linux.run
sudo sh cuda_12.1.0_530.30.02_linux.run
Đừng quên cấu hình biến môi trường trong file .bashrc:
Bash
export PATH=/usr/local/cuda-12.1/bin${PATH:+:${PATH}}
export LD_LIBRARY_PATH=/usr/local/cuda-12.1/lib64${LD_LIBRARY_PATH:+:${LD_LIBRARY_PATH}}

3. Bước 2: Quản lý môi trường với Anaconda/Miniconda
Trong giới làm AI, việc cài đặt trực tiếp mọi thứ vào Python hệ thống là một sai lầm lớn dễ dẫn đến xung đột thư viện. Chúng ta nên sử dụng Conda để tạo các môi trường ảo (Virtual Environments) riêng biệt cho PyTorch và TensorFlow.
Cài đặt Miniconda:
Bash
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh
4. Bước 3: Thiết lập môi trường PyTorch
PyTorch được yêu thích bởi tính linh hoạt và dễ debug. Để cài đặt bản tối ưu cho server GPU:
Tạo môi trường mới:
Bash
conda create -n pytorch_env python=3.10
conda activate pytorch_env
Cài đặt PyTorch với hỗ trợ CUDA: Truy cập trang chủ PyTorch để lấy câu lệnh chính xác nhất cho phiên bản CUDA của bạn. Ví dụ:
Bash
pip3 install torch torchvision torchaudio –index-url https://download.pytorch.org/whl/cu121
Kiểm tra kết nối GPU: Mở Python và chạy dòng lệnh sau:
Python
import torch
print(torch.cuda.is_available()) # Kết quả True là thành công
print(torch.cuda.get_device_name(0))

5. Bước 4: Thiết lập môi trường TensorFlow
TensorFlow thường khắt khe hơn về phiên bản CUDA và cuDNN.
Tạo môi trường mới:
Bash
conda create -n tf_env python=3.9
conda activate tf_env
Cài đặt TensorFlow: Từ bản 2.x, TensorFlow đã gộp chung bản CPU và GPU vào một gói cài đặt:
Bash
pip install tensorflow[and-cuda] Kiểm tra kết nối GPU:
Python
import tensorflow as tf
print(tf.config.list_physical_devices(‘GPU’))

6. Bước 5: Cài đặt cuDNN (Deep Neural Network Library)
cuDNN là thư viện của NVIDIA giúp tăng tốc các phép tính tích chập (Convolutional) trong Deep Learning. Để cài đặt:
Tải file cuDNN từ NVIDIA Developer Program.
Giải nén và copy các file header/library vào thư mục CUDA tương ứng.
Việc này cực kỳ quan trọng để đạt được mức FPS cao nhất khi training model ảnh (Computer Vision).
7. Sử dụng Docker – Giải pháp thay thế nhanh chóng
Nếu bạn không muốn mất thời gian cài đặt từng bước, Docker là giải pháp tuyệt vời. NVIDIA cung cấp các bản Image có sẵn (NVIDIA Container Toolkit) đã được tối ưu hóa toàn bộ Driver và Framework.
Tại Adtech, chúng tôi hỗ trợ khách hàng triển khai Docker cực nhanh, bạn chỉ cần kéo Image từ Docker Hub về và chạy:
Bash
docker pull pytorch/pytorch:latest-cuda12.1-cudnn8-runtime
Cách này giúp môi trường của bạn luôn “sạch” và dễ dàng di chuyển giữa các server khác nhau.

8. Tại sao nên chọn Cloud GPU Server tại Adtech để làm AI?
Việc tự setup môi trường có thể gặp rất nhiều lỗi về tương thích (Compatibility). Dịch vụ của Adtech mang lại những lợi thế vượt trội:
Image mẫu sẵn có: Chúng tôi cung cấp các mẫu OS cài sẵn Driver NVIDIA, CUDA, cuDNN và các Framework phổ biến. Bạn chỉ mất 5 phút để bắt đầu thay vì 5 tiếng tự mò mẫm.
Hiệu năng không hao hụt: Hệ thống Cloud tại Adtech được tối ưu hóa để GPU có thể truy cập trực tiếp (Pass-through), đảm bảo hiệu năng đạt 99% so với máy vật lý.
Băng thông nội bộ cực cao: Giúp việc tải các tập dữ liệu lớn (Dataset) từ Storage sang GPU Server diễn ra trong tích tắc.
Hỗ trợ chuyên gia: Nếu bạn gặp lỗi khi cài đặt thư viện, đội ngũ kỹ thuật am hiểu về AI của Adtech luôn sẵn sàng hỗ trợ.
9. Kết luận
Thiết lập môi trường là bước chạy đà quan trọng cho bất kỳ dự án AI nào. Dù bạn chọn PyTorch vì sự linh hoạt hay TensorFlow vì tính đóng gói mạnh mẽ, một hệ thống GPU Server chuẩn chỉnh sẽ giúp bạn rút ngắn đáng kể thời gian nghiên cứu và phát triển.
Đừng để những rắc rối về cài đặt làm chậm tiến độ dự án của bạn. Hãy để Adtech đồng hành cùng bạn với hạ tầng Cloud GPU mạnh mẽ và dịch vụ hỗ trợ kỹ thuật tận tâm nhất!
