Trí tuệ nhân tạo cho mọi ngôn ngữ

Mọi ngôn ngữ đều đáng được lắng nghe

Lớn hay nhỏ, ngôn ngữ nào cũng bình đẳng. RANA Labs phát triển công nghệ tổng hợp lời nói, dịch máy và trò chuyện với AI để mọi người hiểu nhau dễ dàng hơn, ngay bằng tiếng mẹ đẻ của mình.

01Công nghệ

Ba nền tảng AI, một kiến trúc thế hệ mới

Chúng tôi kết hợp những kiến trúc học sâu hiện đại nhất với dữ liệu được chọn lọc kỹ, để AI không chỉ đúng mà còn tự nhiên như người thật, từ âm thanh, ngữ điệu đến cách nói đời thường, giúp những người nói các thứ tiếng khác nhau trò chuyện với nhau dễ dàng.

Giọng nói nơ-ron, tự nhiên đến từng hơi thở

Mô hình học trực tiếp từ hàng giờ giọng đọc thật, tái tạo cao độ, nhịp điệu và sắc thái của người nói, với nhiều chất giọng và vùng miền.

  • Mô hình đầu-cuốiVăn bản đi thẳng thành âm thanh qua mạng nơ-ron, không ghép nối từng mảnh ghi âm.
  • Mã hóa âm thanh nơ-ronNén và tái tạo âm thanh độ phân giải cao, đầu ra trong trẻo tới 48 kHz.
  • Nhân bản giọng từ ít mẫuHọc chất giọng mới từ vài phút ghi âm, giữ đúng vùng miền và cá tính.
  • Ngữ điệu và chuẩn hóaNgắt nghỉ theo dấu câu, tự đọc số, ngày tháng và ký hiệu thành lời.
Tổng hợp lời nóiĐang đọc
Giọng đọc AITự nhiên · 48 kHz
1.0×

0:00Văn bảnÂm vịMã âm thanhSóng âm0:00

Dịch theo ngữ cảnh với cơ chế chú ý

Mô hình đọc trọn câu, cân nhắc từng từ trong mối liên hệ với cả câu rồi mới viết bản dịch, giữ đúng ý và cách diễn đạt, để hai người nói hai thứ tiếng vẫn hiểu nhau.

  • Kiến trúc TransformerCơ chế chú ý đa đầu nắm bắt quan hệ giữa các từ, kể cả khi trật tự câu khác nhau.
  • Học chuyển giaoKế thừa kiến thức từ mô hình nền tảng đã học hàng trăm ngôn ngữ.
  • Dịch ngược, khứ hồiSinh thêm dữ liệu, dịch đi rồi dịch về để loại các bản dịch lệch nghĩa.
  • Tên riêng và chính tảGiữ nguyên tên người, địa danh và tuân theo chuẩn chữ viết của cộng đồng.
Dịch máy · Cơ chế chú ýĐang dịch
Câu gốcMã hóa
Bản dịchGiải mã

Nghe, hiểu và trả lời bằng giọng nói

Các mô hình phối hợp thành một vòng khép kín, để bạn chỉ cần nói và nghe như đang trò chuyện với người thật, ngay bằng tiếng mẹ đẻ.

  • Nhận dạng giọng nóiChuyển lời nói thành chữ, chịu được tiếng ồn và nhiều cách phát âm.
  • Mô hình ngôn ngữ lớnHiểu câu hỏi, giữ mạch hội thoại và trả lời mạch lạc.
  • Truy xuất tri thứcTra cứu nguồn đáng tin cậy trước khi trả lời, hạn chế bịa đặt.
  • Phản hồi theo luồngVừa nghĩ vừa nói, rút ngắn thời gian chờ còn trong tích tắc.
Trợ lý AI · Giọng nóiSẵn sàng

  1. Nghe
  2. Hiểu
  3. Tra cứu
  4. Trả lời
  5. Nói
02Vì sao chúng tôi làm

Không ngôn ngữ nào nhỏ bé

Các trợ lý AI phổ biến hôm nay chủ yếu phục vụ những ngôn ngữ lớn. Chúng tôi tin tiếng nói nào cũng cần được lắng nghe như nhau, và ai cũng xứng đáng dùng công nghệ bằng chính tiếng của mình.

01

Gìn giữ tiếng mẹ đẻ

Lưu giữ giọng nói, từ ngữ và cách nói của cộng đồng để ngôn ngữ tiếp tục sống trong thời đại số.

02

Hiểu nhau dễ dàng hơn

Nói bằng tiếng của mình mà vẫn được người khác hiểu. Nghe, đọc, hỏi đáp và học tập không còn rào cản ngôn ngữ.

03

Cùng cộng đồng xây dựng

Dữ liệu và kết quả được người bản ngữ kiểm chứng, để AI nói đúng, dịch đúng và tôn trọng văn hóa.

03Huấn luyện tiên tiến

Học nhiều hơn từ ít dữ liệu hơn

Ngôn ngữ ít phổ biến hiếm khi có sẵn dữ liệu lớn. Vì vậy chúng tôi áp dụng những phương pháp huấn luyện hiện đại nhất để mỗi câu, mỗi giây ghi âm đều có giá trị.

0vòng huấn luyện
Bắt đầuSai số giảm dần theo thời gian
Dữ liệu họcDữ liệu kiểm tra riêng
  1. 01

    Học chuyển giao

    Bắt đầu từ mô hình nền tảng đã hiểu hàng trăm ngôn ngữ, rồi chuyên sâu cho ngôn ngữ mới với ít dữ liệu hơn nhiều.

  2. 02

    Học tự giám sát

    Mô hình tự khám phá cấu trúc của âm thanh và văn bản từ dữ liệu chưa gán nhãn, trước khi học nhiệm vụ cụ thể.

  3. 03

    Tinh chỉnh hiệu quả

    Chỉ cập nhật một phần nhỏ tham số: giữ kiến thức nền mà vẫn thích nghi nhanh với giọng và ngôn ngữ mới.

  4. 04

    Tăng cường dữ liệu

    Dịch ngược, thay đổi tốc độ, cao độ và môi trường âm thanh để mô hình vững vàng trong điều kiện thực tế.

  5. 05

    Huấn luyện trên GPU đám mây

    Tính toán song song với độ chính xác hỗn hợp, rút ngắn thời gian huấn luyện từ hàng tuần xuống vài giờ.

  6. 06

    Tối ưu để chạy mọi nơi

    Lượng tử hóa và tối ưu mô hình để chạy nhanh trên máy chủ thông thường, không cần phần cứng đắt tiền.

04Quy trình

Từ từng âm, từng từ đến cả cuộc trò chuyện

Mỗi mô hình đi qua bốn bước, trong đó con người luôn có mặt ở vòng kiểm chứng trước khi công nghệ đến tay mọi người.

BƯỚC 1

Thu thập dữ liệu

Cùng cộng đồng thu thập văn bản và giọng nói chất lượng, có sự đồng ý của người đóng góp.

BƯỚC 2

Huấn luyện mô hình

Mô hình AI học âm thanh, từ vựng, ngữ pháp và ngữ điệu riêng của ngôn ngữ.

BƯỚC 3

Người bản ngữ kiểm chứng

Kết quả được nghe, đọc và chỉnh sửa bởi người bản ngữ trước khi dùng rộng rãi.

BƯỚC 4

Đưa vào cuộc sống

Công nghệ đến với mọi người và tiếp tục học thêm mỗi ngày từ góp ý thực tế.

05Chất lượng

Đo bằng con số, kiểm chứng bằng con người

Mỗi phiên bản mô hình đều phải vượt qua các bài đánh giá tự động và được người bản ngữ nghe, đọc trước khi đến tay mọi người.

0kHz

Âm thanh độ phân giải cao

Giọng nói đầu ra trong trẻo, rõ từng phụ âm cuối.

0×

Nhanh hơn thời gian thực

Trên máy chủ thường, một giây tính toán tạo được khoảng bảy giây lời nói.

0thước đo

Cho mỗi giọng nói

Độ tự nhiên, độ rõ chữ, độ giống giọng và cao độ.

0%

Người bản ngữ duyệt

Kết quả AI chỉ được dùng để huấn luyện sau khi người bản ngữ xác nhận.

Phương pháp đánh giá Điểm tự nhiên MOSTỉ lệ lỗi ký tựĐộ giống giọng nóiPhân tích cao độDịch khứ hồiNghe thử mù A/B

Có sự đồng ý

Giọng nói và dữ liệu chỉ được dùng khi người đóng góp đồng ý.

Bảo mật

Kết nối mã hóa, truy cập máy chủ được kiểm soát chặt chẽ.

Tôn trọng văn hóa

Chữ viết, cách nói và giá trị của cộng đồng luôn được giữ đúng.

Minh bạch

Nói rõ đâu là kết quả do AI tạo ra, đâu là của con người.

06Sắp ra mắt

Những sản phẩm AI đang trên đường đến

RANA Labs đang phát triển các sản phẩm AI về lời nói, dịch thuật và trò chuyện. Chúng sẽ lần lượt ra mắt và mở rộng dần sang nhiều ngôn ngữ, để không tiếng nói nào bị bỏ lại phía sau.

Giọng nói AI Dịch thuật AI Trợ lý trò chuyện AI Thêm nhiều ngôn ngữ