AiChatGPT Whisper bài số 17 : detect_language bằng Python
1. Trọng tâm
Bài này tập trung trực tiếp vào **detect_language bằng Python** trong pipeline Whisper, từ dữ liệu audio đầu vào đến output có thể kiểm tra được.
2. Thực hành
audio = whisper.load_audio("audio.mp3")
audio = whisper.pad_or_trim(audio)
mel = whisper.log_mel_spectrogram(audio, n_mels=model.dims.n_mels).to(model.device)
_, probs = model.detect_language(mel)
print(max(probs, key=probs.get))
3. Cần quan sát gì?
- Ngôn ngữ nhận diện có đúng không.
- Từ chuyên ngành/tên riêng bị sai ở đâu.
- Timestamp có bám audio không.
- Thời gian xử lý và tài nguyên phần cứng.
4. Lỗi thường gặp
Không nên mặc định lỗi transcript luôn do model: audio đầu vào, FFmpeg, language, model size, thiết bị chạy và decoding options đều có thể ảnh hưởng kết quả.
5. Bài tập
- Chạy ví dụ với audio 30–60 giây.
- Thử ít nhất hai cấu hình/model khi phù hợp.
- Ghi lại tốc độ và ba lỗi transcript.
- Đề xuất cách cải thiện dựa trên dữ liệu vừa quan sát.