Mọi ngôn ngữ đều đáng được lắng nghe
Lớn hay nhỏ, ngôn ngữ nào cũng bình đẳng. RANA Labs phát triển công nghệ tổng hợp lời nói, dịch máy và trò chuyện với AI để mọi người hiểu nhau dễ dàng hơn, ngay bằng tiếng mẹ đẻ của mình.
Ba nền tảng AI, một kiến trúc thế hệ mới
Chúng tôi kết hợp những kiến trúc học sâu hiện đại nhất với dữ liệu được chọn lọc kỹ, để AI không chỉ đúng mà còn tự nhiên như người thật, từ âm thanh, ngữ điệu đến cách nói đời thường, giúp những người nói các thứ tiếng khác nhau trò chuyện với nhau dễ dàng.
Giọng nói nơ-ron, tự nhiên đến từng hơi thở
Mô hình học trực tiếp từ hàng giờ giọng đọc thật, tái tạo cao độ, nhịp điệu và sắc thái của người nói, với nhiều chất giọng và vùng miền.
- Mô hình đầu-cuốiVăn bản đi thẳng thành âm thanh qua mạng nơ-ron, không ghép nối từng mảnh ghi âm.
- Mã hóa âm thanh nơ-ronNén và tái tạo âm thanh độ phân giải cao, đầu ra trong trẻo tới 48 kHz.
- Nhân bản giọng từ ít mẫuHọc chất giọng mới từ vài phút ghi âm, giữ đúng vùng miền và cá tính.
- Ngữ điệu và chuẩn hóaNgắt nghỉ theo dấu câu, tự đọc số, ngày tháng và ký hiệu thành lời.
Dịch theo ngữ cảnh với cơ chế chú ý
Mô hình đọc trọn câu, cân nhắc từng từ trong mối liên hệ với cả câu rồi mới viết bản dịch, giữ đúng ý và cách diễn đạt, để hai người nói hai thứ tiếng vẫn hiểu nhau.
- Kiến trúc TransformerCơ chế chú ý đa đầu nắm bắt quan hệ giữa các từ, kể cả khi trật tự câu khác nhau.
- Học chuyển giaoKế thừa kiến thức từ mô hình nền tảng đã học hàng trăm ngôn ngữ.
- Dịch ngược, khứ hồiSinh thêm dữ liệu, dịch đi rồi dịch về để loại các bản dịch lệch nghĩa.
- Tên riêng và chính tảGiữ nguyên tên người, địa danh và tuân theo chuẩn chữ viết của cộng đồng.
Nghe, hiểu và trả lời bằng giọng nói
Các mô hình phối hợp thành một vòng khép kín, để bạn chỉ cần nói và nghe như đang trò chuyện với người thật, ngay bằng tiếng mẹ đẻ.
- Nhận dạng giọng nóiChuyển lời nói thành chữ, chịu được tiếng ồn và nhiều cách phát âm.
- Mô hình ngôn ngữ lớnHiểu câu hỏi, giữ mạch hội thoại và trả lời mạch lạc.
- Truy xuất tri thứcTra cứu nguồn đáng tin cậy trước khi trả lời, hạn chế bịa đặt.
- Phản hồi theo luồngVừa nghĩ vừa nói, rút ngắn thời gian chờ còn trong tích tắc.
- Nghe
- Hiểu
- Tra cứu
- Trả lời
- Nói
Không ngôn ngữ nào nhỏ bé
Các trợ lý AI phổ biến hôm nay chủ yếu phục vụ những ngôn ngữ lớn. Chúng tôi tin tiếng nói nào cũng cần được lắng nghe như nhau, và ai cũng xứng đáng dùng công nghệ bằng chính tiếng của mình.
Gìn giữ tiếng mẹ đẻ
Lưu giữ giọng nói, từ ngữ và cách nói của cộng đồng để ngôn ngữ tiếp tục sống trong thời đại số.
Hiểu nhau dễ dàng hơn
Nói bằng tiếng của mình mà vẫn được người khác hiểu. Nghe, đọc, hỏi đáp và học tập không còn rào cản ngôn ngữ.
Cùng cộng đồng xây dựng
Dữ liệu và kết quả được người bản ngữ kiểm chứng, để AI nói đúng, dịch đúng và tôn trọng văn hóa.
Học nhiều hơn từ ít dữ liệu hơn
Ngôn ngữ ít phổ biến hiếm khi có sẵn dữ liệu lớn. Vì vậy chúng tôi áp dụng những phương pháp huấn luyện hiện đại nhất để mỗi câu, mỗi giây ghi âm đều có giá trị.
- 01
Học chuyển giao
Bắt đầu từ mô hình nền tảng đã hiểu hàng trăm ngôn ngữ, rồi chuyên sâu cho ngôn ngữ mới với ít dữ liệu hơn nhiều.
- 02
Học tự giám sát
Mô hình tự khám phá cấu trúc của âm thanh và văn bản từ dữ liệu chưa gán nhãn, trước khi học nhiệm vụ cụ thể.
- 03
Tinh chỉnh hiệu quả
Chỉ cập nhật một phần nhỏ tham số: giữ kiến thức nền mà vẫn thích nghi nhanh với giọng và ngôn ngữ mới.
- 04
Tăng cường dữ liệu
Dịch ngược, thay đổi tốc độ, cao độ và môi trường âm thanh để mô hình vững vàng trong điều kiện thực tế.
- 05
Huấn luyện trên GPU đám mây
Tính toán song song với độ chính xác hỗn hợp, rút ngắn thời gian huấn luyện từ hàng tuần xuống vài giờ.
- 06
Tối ưu để chạy mọi nơi
Lượng tử hóa và tối ưu mô hình để chạy nhanh trên máy chủ thông thường, không cần phần cứng đắt tiền.
Từ từng âm, từng từ đến cả cuộc trò chuyện
Mỗi mô hình đi qua bốn bước, trong đó con người luôn có mặt ở vòng kiểm chứng trước khi công nghệ đến tay mọi người.
Thu thập dữ liệu
Cùng cộng đồng thu thập văn bản và giọng nói chất lượng, có sự đồng ý của người đóng góp.
Huấn luyện mô hình
Mô hình AI học âm thanh, từ vựng, ngữ pháp và ngữ điệu riêng của ngôn ngữ.
Người bản ngữ kiểm chứng
Kết quả được nghe, đọc và chỉnh sửa bởi người bản ngữ trước khi dùng rộng rãi.
Đưa vào cuộc sống
Công nghệ đến với mọi người và tiếp tục học thêm mỗi ngày từ góp ý thực tế.
Đo bằng con số, kiểm chứng bằng con người
Mỗi phiên bản mô hình đều phải vượt qua các bài đánh giá tự động và được người bản ngữ nghe, đọc trước khi đến tay mọi người.
Âm thanh độ phân giải cao
Giọng nói đầu ra trong trẻo, rõ từng phụ âm cuối.
Nhanh hơn thời gian thực
Trên máy chủ thường, một giây tính toán tạo được khoảng bảy giây lời nói.
Cho mỗi giọng nói
Độ tự nhiên, độ rõ chữ, độ giống giọng và cao độ.
Người bản ngữ duyệt
Kết quả AI chỉ được dùng để huấn luyện sau khi người bản ngữ xác nhận.
Có sự đồng ý
Giọng nói và dữ liệu chỉ được dùng khi người đóng góp đồng ý.
Bảo mật
Kết nối mã hóa, truy cập máy chủ được kiểm soát chặt chẽ.
Tôn trọng văn hóa
Chữ viết, cách nói và giá trị của cộng đồng luôn được giữ đúng.
Minh bạch
Nói rõ đâu là kết quả do AI tạo ra, đâu là của con người.
Những sản phẩm AI đang trên đường đến
RANA Labs đang phát triển các sản phẩm AI về lời nói, dịch thuật và trò chuyện. Chúng sẽ lần lượt ra mắt và mở rộng dần sang nhiều ngôn ngữ, để không tiếng nói nào bị bỏ lại phía sau.