Tuyển Intern/Junior AI Engineer (Speech AI) tại Trivita AI, nghiên cứu và phát triển ASR, TTS, Speech Enhancement và các công nghệ xử lý giọng nói.
Mô tả công việc
- Nghiên cứu và phát triển các giải pháp Speech AI liên quan đến:
- Speech-to-Text (ASR)
- Text-to-Speech (TTS)
- Speech Enhancement / Denoising
- Voice Activity Detection (VAD)
- Speaker Diarization / Speaker Recognition
- Xây dựng pipeline xử lý và đánh giá dữ liệu âm thanh.
- Tiền xử lý, gán nhãn, kiểm tra và phân tích dữ liệu speech.
- Thử nghiệm các mô hình open-source hoặc commercial như Whisper, wav2vec 2.0, MMS, NVIDIA NeMo, CosyVoice và các mô hình tương tự.
- Fine-tune hoặc tối ưu mô hình cho tiếng Việt và các bối cảnh sử dụng thực tế.
- Đánh giá chất lượng mô hình thông qua các chỉ số như WER, CER, MOS, latency và throughput.
- Phối hợp với đội ngũ Backend/MLOps để triển khai mô hình thành API hoặc service trong môi trường production.
- Đọc tài liệu kỹ thuật, nghiên cứu paper và cập nhật các công nghệ mới trong lĩnh vực Speech AI.
Yêu cầu đối với Intern
- Sinh viên năm 3, năm 4 hoặc mới tốt nghiệp các ngành Computer Science, Artificial Intelligence, Data Science, Electrical/Computer Engineering hoặc các ngành liên quan.
- Có kiến thức cơ bản về Python, Machine Learning và Deep Learning.
- Có kiến thức về xử lý tín hiệu hoặc audio là một lợi thế.
- Đã sử dụng các framework như PyTorch hoặc TensorFlow.
- Có tinh thần tự học, chủ động thử nghiệm và khả năng đọc tài liệu kỹ thuật.
Yêu cầu đối với Junior
- Có từ 6 tháng đến 2 năm kinh nghiệm làm việc với AI/ML hoặc Speech AI.
- Thành thạo Python và ít nhất một framework Deep Learning, ưu tiên PyTorch.
- Có hiểu biết về một hoặc nhiều lĩnh vực như ASR/TTS, Audio Classification, Speech Enhancement, Voice Conversion hoặc Speaker Diarization.
- Có kinh nghiệm làm việc với audio dataset, feature extraction và model evaluation.
- Biết sử dụng Git, Docker và Linux.
- Có khả năng triển khai mô hình thành API là một lợi thế.
Điểm cộng
- Có project cá nhân hoặc nghiên cứu liên quan đến Speech AI.
- Có kinh nghiệm với Whisper, wav2vec 2.0, NVIDIA NeMo, Hugging Face hoặc ONNX.
- Hiểu về Mel-spectrogram, MFCC, FFT, sampling rate và noise reduction.
- Có kinh nghiệm tối ưu inference như quantization, batching, streaming hoặc GPU serving.
- Có bài viết, paper, GitHub project hoặc đóng góp cho các dự án open-source.
Quyền lợi
- Tham gia phát triển các sản phẩm Speech AI thực tế phục vụ người dùng.
- Được hướng dẫn bởi các kỹ sư có kinh nghiệm về hệ thống AI và môi trường production.
- Có cơ hội làm việc với dữ liệu tiếng Việt và các bài toán Speech AI quy mô lớn.
- Được tiếp cận quá trình model training, evaluation, deployment và tối ưu hiệu năng.
- Môi trường khuyến khích nghiên cứu, thử nghiệm và đóng góp ý tưởng.
- Có cơ hội trở thành nhân viên chính thức sau kỳ thực tập.
Thông tin liên hệ
- Địa điểm: Số 01, đường số 104, khu phố 3, phường Bình Trưng, Thành phố Hồ Chí Minh
- Điện thoại: 0909797699
- Email: hr@trivita.ai

