Đố vui - Giải đáp

Hướng dẫn tạo và train model QN_New trên Applio

Quy trình từng bước cho máy Windows chạy CPU, dùng bộ audio mới sạch và êm hơn bộ cũ.

1. Mục tiêu

Tạo model mới QN_New bằng bộ audio mới. Mục tiêu là giọng êm, rõ lời, tự nhiên và dễ nghe; không chạy theo việc làm giọng trầm nhất.

Nguyên tắc: làm từng bước, kiểm tra sau mỗi giai đoạn và không xóa model cũ Quoc_Nguyen.

2. Tạo dataset mới

C:\Users\DELL\Downloads\ApplioV3.6.4\assets\datasets\QN_New

Đưa audio giọng thật mới vào thư mục này. File đã dùng trong quy trình là anh da khong giu.ogg, dài khoảng 1 phút 16 giây.

3. Mở Applio

http://127.0.0.1:6969
Mục Giá trị
Model Name QN_New
Sampling Rate 40000
Vocoder HiFi-GAN
CPU Cores 2
GPU Number -

4. Preprocess Dataset

Trong Preprocess chọn assets\datasets\QN_New. Nếu QN_New chưa xuất hiện, bấm Refresh.

Thiết lập Giá trị
Audio cutting Automatic
Chunk length 3 giây
Overlap length 0.3 giây
Noise filter Tắt
Noise Reduction Tắt
Normalization mode post

Bấm Preprocess Dataset. Chỉ đi tiếp khi hiện: Model QN_New preprocessed successfully.

5. Extract Features

Thiết lập Giá trị
Pitch extraction algorithm rmvpe
Embedder Model contentvec
Silent training files 2

Bấm Extract Features. Chỉ đi tiếp khi hiện: Model QN_New extracted successfully.

Nếu báo thiếu logs\QN_New\sliced_audios_16k, hãy chạy lại Preprocess Dataset thành công rồi mới Extract.

6. Thiết lập Training

Mục Giá trị
Batch Size 1
Save Every Epoch 5
Total Epoch 15

7. Advanced Settings

Mục Thiết lập
Save Only Latest Tắt
Fresh Training Bật
Save Every Weights Bật
Pretrained Bật
Cache Dataset in GPU Tắt
Checkpointing Tắt
Shutdown after finishing Tắt
Custom Pretrained Tắt
Index Algorithm Auto
I agree to the terms of use Tích

Fresh Training chỉ dùng cho model mới. Không bật nó khi muốn tiếp tục model cũ.

8. Bắt đầu train

Sau khi kiểm tra toàn bộ thiết lập, bấm Start Training. Vì máy chạy CPU, thời gian train có thể dài. Không đóng bảng console đang chạy Applio.

9. Test và chọn epoch

Nghe theo thứ tự 5 → 10 → 15. Ưu tiên độ êm, rõ lời, tự nhiên và màu giọng phù hợp. Epoch cao không phải lúc nào cũng tốt hơn.

Model cũ từng cho cảm nhận: epoch 10 êm hơn, epoch 15 có màu giọng rõ hơn nhưng nặng hơn, epoch 20 quá trầm. QN_New phải được đánh giá riêng.

10. Nếu máy mất nguồn

Model đã lưu trước đó thường vẫn còn; epoch đang chạy dở nhưng chưa kịp lưu có thể mất. Không train lại từ đầu ngay. Kiểm tra:

C:\Users\DELL\Downloads\ApplioV3.6.4\logs\QN_New

Và đọc log dạng Loaded checkpoint ... (epoch X) trước khi resume.

11. Lỗi đã gặp

Thiếu sliced_audios_16k

Chạy Preprocess Dataset thành công trước, rồi mới Extract Features.

WinError 1455

Windows thiếu bộ nhớ ảo. Giữ Batch Size thấp, đóng bớt ứng dụng nặng và kiểm tra virtual memory nếu lỗi lặp lại.

Discord

Thông báo không tìm thấy Discord không phải nguyên nhân chính nếu Applio vẫn chạy bình thường ở 127.0.0.1:6969.

12. Checklist nhanh

  • Model Name = QN_New
  • Dataset Path = assets\datasets\QN_New
  • Preprocess thành công
  • Extract Features thành công
  • CPU Cores = 2; GPU = -
  • Batch Size = 1; Save Every Epoch = 5; Total Epoch = 15
  • Save Only Latest OFF; Fresh Training ON; Save Every Weights ON; Pretrained ON
  • Index Algorithm = Auto; terms of use đã tích

Tài liệu được biên soạn từ quy trình đã thực hiện với Applio V3.6.4 trên máy Windows/CPU.

13. Hướng dẫn chi tiết từng bước tạo và train model QN_New

Bước 1 — Tạo model mới

Đặt Model Name là QN_New. Giữ Sampling Rate 40000 và Vocoder HiFi-GAN. CPU Cores = 2, GPU Number = -.

Chưa bấm Start Training ở bước này.

Bước 2 — Chọn dataset QN_New

Trong Preprocess, Dataset Path phải là assets\datasets\QN_New. Audio cutting = Automatic; Chunk length = 3 giây; Overlap = 0,3 giây; Noise filter và Noise Reduction tắt; Normalization = post.

Sau khi tạo thư mục dataset mới, bấm Refresh để Applio nhận QN_New.

Bước 3 — Preprocess Dataset

Kiểm tra khu vực Output Information và bấm Preprocess Dataset. Chỉ đi tiếp khi Applio báo Model QN_New preprocessed successfully.

Nếu Extract Features báo thiếu logs\QN_New\sliced_audios_16k, hãy quay lại Preprocess và chạy thành công trước.

Bước 4 — Extract Features

Pitch = rmvpe; Embedder = contentvec. Silent training files = 2. Bấm Extract Features và chờ báo Model QN_New extracted successfully.

Chưa bấm Start Training trước khi Extract hoàn tất.

Bước 5 — Cài thông số Training

Batch Size = 1; Save Every Epoch = 5; Total Epoch = 15.

Các mốc 5 → 10 → 15 giúp dễ nghe và so sánh model. Máy đang chạy CPU nên giữ Batch Size 1.

Bước 6 — Advanced Settings

Save Only Latest = OFF; Fresh Training = ON; Save Every Weights = ON; Pretrained = ON; Cache Dataset in GPU = OFF; Checkpointing = OFF; Shutdown after finishing = OFF.

Fresh Training chỉ dùng cho model QN_New mới, không dùng khi resume model cũ.

Bước 7 — Index và bắt đầu train

Index Algorithm = Auto. Tích I agree to the terms of use. Khi mọi thứ đã đúng, bấm Start Training.

Không đóng cửa sổ console/bảng đen trong lúc train.

Checklist trước khi Start Training

  • Model Name = QN_New
  • Dataset Path = assets\datasets\QN_New
  • Preprocess thành công
  • Extract Features thành công
  • CPU Cores = 2, GPU Number = -
  • Batch Size = 1, Save Every Epoch = 5, Total Epoch = 15
  • Save Only Latest = OFF
  • Fresh Training = ON
  • Save Every Weights = ON, Pretrained = ON
  • Index Algorithm = Auto
  • I agree to the terms of use = ON

Mục tiêu chọn model: ưu tiên giọng êm, rõ lời, tự nhiên và không quá “ồ”/nặng. Epoch cao không mặc định tốt hơn.

Tài liệu được biên soạn từ các bước thực tế đã thực hiện trong cuộc trò chuyện. Các ảnh minh họa là ảnh chụp màn hình của chính quá trình đó, đã được crop để tập trung vào từng khu vực thao tác.