Quy trình từng bước cho máy Windows chạy CPU, dùng bộ audio mới sạch và êm hơn bộ cũ.
Mục lục [Ẩn]
1. Mục tiêu
Tạo model mới QN_New bằng bộ audio mới. Mục tiêu là giọng êm, rõ lời, tự nhiên và dễ nghe; không chạy theo việc làm giọng trầm nhất.
Nguyên tắc: làm từng bước, kiểm tra sau mỗi giai đoạn và không xóa model cũ Quoc_Nguyen.
2. Tạo dataset mới
C:\Users\DELL\Downloads\ApplioV3.6.4\assets\datasets\QN_New
Đưa audio giọng thật mới vào thư mục này. File đã dùng trong quy trình là anh da khong giu.ogg, dài khoảng 1 phút 16 giây.
3. Mở Applio
http://127.0.0.1:6969
| Mục | Giá trị |
|---|---|
| Model Name | QN_New |
| Sampling Rate | 40000 |
| Vocoder | HiFi-GAN |
| CPU Cores | 2 |
| GPU Number | - |
4. Preprocess Dataset
Trong Preprocess chọn assets\datasets\QN_New. Nếu QN_New chưa xuất hiện, bấm Refresh.
| Thiết lập | Giá trị |
|---|---|
| Audio cutting | Automatic |
| Chunk length | 3 giây |
| Overlap length | 0.3 giây |
| Noise filter | Tắt |
| Noise Reduction | Tắt |
| Normalization mode | post |
Bấm Preprocess Dataset. Chỉ đi tiếp khi hiện: Model QN_New preprocessed successfully.
5. Extract Features
| Thiết lập | Giá trị |
|---|---|
| Pitch extraction algorithm | rmvpe |
| Embedder Model | contentvec |
| Silent training files | 2 |
Bấm Extract Features. Chỉ đi tiếp khi hiện: Model QN_New extracted successfully.
Nếu báo thiếu logs\QN_New\sliced_audios_16k, hãy chạy lại Preprocess Dataset thành công rồi mới Extract.
6. Thiết lập Training
| Mục | Giá trị |
|---|---|
| Batch Size | 1 |
| Save Every Epoch | 5 |
| Total Epoch | 15 |
7. Advanced Settings
| Mục | Thiết lập |
|---|---|
| Save Only Latest | Tắt |
| Fresh Training | Bật |
| Save Every Weights | Bật |
| Pretrained | Bật |
| Cache Dataset in GPU | Tắt |
| Checkpointing | Tắt |
| Shutdown after finishing | Tắt |
| Custom Pretrained | Tắt |
| Index Algorithm | Auto |
| I agree to the terms of use | Tích |
Fresh Training chỉ dùng cho model mới. Không bật nó khi muốn tiếp tục model cũ.
8. Bắt đầu train
Sau khi kiểm tra toàn bộ thiết lập, bấm Start Training. Vì máy chạy CPU, thời gian train có thể dài. Không đóng bảng console đang chạy Applio.
9. Test và chọn epoch
Nghe theo thứ tự 5 → 10 → 15. Ưu tiên độ êm, rõ lời, tự nhiên và màu giọng phù hợp. Epoch cao không phải lúc nào cũng tốt hơn.
Model cũ từng cho cảm nhận: epoch 10 êm hơn, epoch 15 có màu giọng rõ hơn nhưng nặng hơn, epoch 20 quá trầm. QN_New phải được đánh giá riêng.
10. Nếu máy mất nguồn
Model đã lưu trước đó thường vẫn còn; epoch đang chạy dở nhưng chưa kịp lưu có thể mất. Không train lại từ đầu ngay. Kiểm tra:
C:\Users\DELL\Downloads\ApplioV3.6.4\logs\QN_New
Và đọc log dạng Loaded checkpoint ... (epoch X) trước khi resume.
11. Lỗi đã gặp
Thiếu sliced_audios_16k
Chạy Preprocess Dataset thành công trước, rồi mới Extract Features.
WinError 1455
Windows thiếu bộ nhớ ảo. Giữ Batch Size thấp, đóng bớt ứng dụng nặng và kiểm tra virtual memory nếu lỗi lặp lại.
Discord
Thông báo không tìm thấy Discord không phải nguyên nhân chính nếu Applio vẫn chạy bình thường ở 127.0.0.1:6969.
12. Checklist nhanh
- Model Name =
QN_New - Dataset Path =
assets\datasets\QN_New - Preprocess thành công
- Extract Features thành công
- CPU Cores = 2; GPU =
- - Batch Size = 1; Save Every Epoch = 5; Total Epoch = 15
- Save Only Latest OFF; Fresh Training ON; Save Every Weights ON; Pretrained ON
- Index Algorithm = Auto; terms of use đã tích
Tài liệu được biên soạn từ quy trình đã thực hiện với Applio V3.6.4 trên máy Windows/CPU.
13. Hướng dẫn chi tiết từng bước tạo và train model QN_New
Bước 1 — Tạo model mới
Đặt Model Name là QN_New. Giữ Sampling Rate 40000 và Vocoder HiFi-GAN. CPU Cores = 2, GPU Number = -.
Chưa bấm Start Training ở bước này.
Bước 2 — Chọn dataset QN_New
Trong Preprocess, Dataset Path phải là assets\datasets\QN_New. Audio cutting = Automatic; Chunk length = 3 giây; Overlap = 0,3 giây; Noise filter và Noise Reduction tắt; Normalization = post.
Sau khi tạo thư mục dataset mới, bấm Refresh để Applio nhận QN_New.
Bước 3 — Preprocess Dataset
Kiểm tra khu vực Output Information và bấm Preprocess Dataset. Chỉ đi tiếp khi Applio báo Model QN_New preprocessed successfully.
Nếu Extract Features báo thiếu logs\QN_New\sliced_audios_16k, hãy quay lại Preprocess và chạy thành công trước.
Bước 4 — Extract Features
Pitch = rmvpe; Embedder = contentvec. Silent training files = 2. Bấm Extract Features và chờ báo Model QN_New extracted successfully.
Chưa bấm Start Training trước khi Extract hoàn tất.
Bước 5 — Cài thông số Training
Batch Size = 1; Save Every Epoch = 5; Total Epoch = 15.
Các mốc 5 → 10 → 15 giúp dễ nghe và so sánh model. Máy đang chạy CPU nên giữ Batch Size 1.
Bước 6 — Advanced Settings
Save Only Latest = OFF; Fresh Training = ON; Save Every Weights = ON; Pretrained = ON; Cache Dataset in GPU = OFF; Checkpointing = OFF; Shutdown after finishing = OFF.
Fresh Training chỉ dùng cho model QN_New mới, không dùng khi resume model cũ.
Bước 7 — Index và bắt đầu train
Index Algorithm = Auto. Tích I agree to the terms of use. Khi mọi thứ đã đúng, bấm Start Training.
Không đóng cửa sổ console/bảng đen trong lúc train.
Checklist trước khi Start Training
- Model Name =
QN_New - Dataset Path =
assets\datasets\QN_New - Preprocess thành công
- Extract Features thành công
- CPU Cores = 2, GPU Number = -
- Batch Size = 1, Save Every Epoch = 5, Total Epoch = 15
- Save Only Latest = OFF
- Fresh Training = ON
- Save Every Weights = ON, Pretrained = ON
- Index Algorithm = Auto
- I agree to the terms of use = ON
Mục tiêu chọn model: ưu tiên giọng êm, rõ lời, tự nhiên và không quá “ồ”/nặng. Epoch cao không mặc định tốt hơn.