Topic API
BÍ QUYẾT TỐI ƯU TOKEN KHI SỬ DỤNG AI
Bài viết thực tế về tối ưu token cho AI API. Qua việc rà soát lịch sử hội thoại, tài liệu RAG, dữ liệu trả về từ tool và độ dài phản hồi, số token đầu vào đã giảm từ khoảng 8.000 xuống 1.600 mà vẫn giữ thông tin cần thiết để trả lời người dùng.
Thử biến Google Colab thành máy chủ API để chạy hội thoại giọng nói S2S
PoC này biến Google Colab thành máy chủ WebSocket tạm thời cho AI hội thoại giọng nói. Hệ thống kết hợp faster-whisper large-v3, Gemini 2.5 Flash-Lite, VOICEVOX và Silero VAD, đồng thời giảm độ trễ bằng phản hồi streaming, chia câu và tổng hợp giọng nói song song.
Sự khác biệt lớn giữa PoC và dịch vụ thương mại mà chúng tôi nhận ra khi phát triển AI hội thoại bằng Gemini
PoC AI hội thoại bằng Gemini Live API có thể được xây dựng nhanh, nhưng thương mại hóa làm phát sinh vấn đề về kết nối đồng thời, quota, giám sát, vòng đời model và âm thanh trên từng thiết bị. Bài viết chia sẻ quá trình chuyển từ kết nối trực tiếp trên trình duyệt sang LiveKit và Vertex AI.


