Whisper text to speech là quá trình tạo ra giọng kể chuyện AI nhẹ nhàng, cường độ thấp, đầy hơi thở từ kịch bản viết sẵn — cách truyền tải thì thầm mà bạn nghe thấy trong ASMR, các bản nhạc thiền, truyện kể trước khi ngủ và những bình luận đêm khuya. Đây không phải là một công cụ riêng biệt. Đó là một phong cách đầu ra được tạo ra bởi một giọng nói chuyển văn bản thành giọng nói, có thể là một giọng cài sẵn tự nhiên dịu dàng hoặc một bản sao giọng thì thầm của chính bạn.
Sự phân biệt đó quan trọng hơn nghe có vẻ, bởi vì từ "whisper" mang một nghĩa thứ hai, không liên quan trong thế giới AI. Chúng tôi xây dựng các công cụ Chuyển Văn Bản Thành Giọng Nói, Nhân Bản Giọng Nói và Lồng Tiếng AI xoay quanh ý nghĩa về cách truyền tải: âm thanh của một người nói khẽ, gần với micro, với các dây thanh quản gần như không hoạt động. Dưới đây chúng tôi giải thích cách âm thanh đó thực sự được tạo ra, những biến thể nào tồn tại, và những quyết định đáng cân nhắc trước khi bạn cam kết một kênh hoặc một sản phẩm với giọng thì thầm.
Mục lục
- Chuyển văn bản thành giọng nói kiểu thì thầm thực sự là gì
- Whisper cách truyền tải so với Whisper mô hình phiên âm
- Ba con đường đến một giọng AI thì thầm
- Tại sao giọng nói nhẹ nhàng quan trọng với người sáng tạo, đội nhóm và nhà phát triển
- Điều cần cân nhắc trước khi bạn cam kết với giọng thì thầm
- Lựa chọn bước tiếp theo của bạn
- Câu hỏi thường gặp
Chuyển văn bản thành giọng nói kiểu thì thầm thực sự là gì
Một bộ tổng hợp giọng nói hiện đại làm ba việc theo trình tự. Nó đọc và chuẩn hóa văn bản, quyết định cách phát âm các con số, từ viết tắt và những từ mơ hồ. Nó mô hình hóa ngữ điệu — đường viền âm điệu, nhịp điệu, vị trí nhấn trọng âm, độ dài của các khoảng dừng. Sau đó một thành phần thần kinh chuyển kế hoạch đó thành dạng sóng âm thanh. Tài liệu công khai hướng dẫn API chuyển văn bản thành giọng nói của OpenAI cho thấy hình dạng thực tế của điều này trong một giao diện: một yêu cầu mang theo một mô hình, văn bản cần được nói, và một định danh giọng nói, và âm thanh trả về. Mẫu ba đầu vào đó về cơ bản là cách hoạt động của toàn bộ danh mục này, bao gồm cả của chúng tôi.
Đầu ra kiểu thì thầm gần như hoàn toàn nằm trong giai đoạn thứ hai và thứ ba. Một tiếng thì thầm sinh lý thực sự không có sự rung động của dây thanh quản nào cả — đó là luồng không khí xoáy được định hình bởi miệng và cổ họng, đó là lý do tại sao nó không có giai điệu cao độ theo nghĩa thông thường. Hầu hết các giọng "thì thầm" bạn nghe trong nội dung thương mại không cực đoan đến vậy. Chúng nằm trong một dải nhẹ nhàng hơn: cường độ giọng giảm, hơi thở nghe rõ, tốc độ nói chậm hơn, và các khoảng dừng nhỏ thường xuyên hơn, với vừa đủ độ vang để giữ cho các phụ âm sắc nét và các từ dễ đọc.
Đó là căng thẳng kỹ thuật trong một câu. Đẩy về phía tiếng thì thầm theo nghĩa đen và độ dễ hiểu giảm xuống, đặc biệt trên loa điện thoại và trong những căn phòng ồn ào. Ở quá xa nó và kết quả chỉ đơn giản là một giọng khẽ, không phải một giọng thân mật. Điểm cân bằng thuyết phục là một âm sắc đầy hơi thở được truyền tải ở năng lượng thấp mà không có chất lượng bị bóp nghẹt đến từ việc loại bỏ chi tiết tần số cao.
Công cụ Chuyển Văn Bản Thành Giọng Nói của chúng tôi tiếp cận điều này từ phía giọng nói. Với hơn 300 giọng nói trong thư viện, một phần đáng kể trong số đó đã đọc nhẹ nhàng theo mặc định — các giọng kể chuyện, các giọng trò chuyện bình tĩnh, các giọng có đặc tính ấm áp và năng lượng thấp tự nhiên. Đó là những điểm khởi đầu hợp lý cho nội dung thì thầm, bởi vì bạn đang yêu cầu mô hình nghiêng thêm về một phẩm chất mà nó đã có sẵn thay vì đấu tranh để đưa một giọng sáng, vang thành một tiếng thì thào mà nó chưa bao giờ được huấn luyện để tạo ra.

Whisper cách truyền tải so với Whisper mô hình phiên âm
Tìm kiếm "whisper text to speech" và bạn sẽ gặp hai công nghệ hoàn toàn khác nhau mang cùng một cái tên. Sắp xếp chúng ra sớm sẽ tiết kiệm rất nhiều thời gian đánh giá lãng phí.
Whisper của OpenAI là một mô hình nhận dạng giọng nói tự động — nó chuyển âm thanh thành văn bản. Nó đã được giới thiệu như một hệ thống được huấn luyện trên 680.000 giờ âm thanh đa ngôn ngữ, được xây dựng để phiên âm mạnh mẽ trên nhiều giọng, từ vựng kỹ thuật và tiếng ồn nền. Một hướng dẫn thực hành về Whisper AI mô tả nó là một mô hình nhận dạng mã nguồn mở bao phủ 99 ngôn ngữ, có sẵn dưới dạng cài đặt cục bộ hoặc thông qua một API phiên âm được lưu trữ. Microsoft ghi lại cùng mô hình đó bên trong Azure để phiên âm các tệp âm thanh và dịch các ngôn ngữ khác sang tiếng Anh. Không có gì trong dòng dõi đó tạo ra giọng nói.
Hướng đi là toàn bộ sự khác biệt. Whisper lấy âm thanh và cho bạn từ ngữ. Chuyển văn bản thành giọng nói kiểu thì thầm lấy từ ngữ và cho bạn âm thanh — một cách khẽ khàng.
Có một cầu nối thực sự giữa hai ý tưởng này, đáng biết nếu bạn thích khía cạnh kiến trúc. Dự án mã nguồn mở WhisperSpeech mô tả chính nó như một hệ thống chuyển văn bản thành giọng nói được xây dựng bằng cách đảo ngược mô hình Whisper, cho thấy rằng một kiến trúc nhận dạng có thể được xoay ngược lại và sử dụng để tạo sinh. Đó là một bằng chứng thú vị rằng hai họ này chia sẻ các biểu diễn cơ bản về giọng nói. Tuy nhiên, đó không phải là điều mà một người sáng tạo muốn nói khi họ yêu cầu một giọng thì thầm, và nó không thay đổi việc đánh giá thực tế trước mắt bạn.
Lý do chúng tôi nhấn mạnh điểm này là vì sự nhầm lẫn dẫn đến những sai lầm thực sự. Các đội nhóm đã đi tìm một giọng thì thầm trong một sản phẩm phiên âm, kết luận rằng tính năng đó không tồn tại, và từ bỏ toàn bộ một định dạng nội dung. Điều bạn thực sự muốn là một giọng tổng hợp giọng nói với cách truyền tải nhẹ nhàng, và đó là một điều được hỗ trợ tốt để yêu cầu.
Ba con đường đến một giọng AI thì thầm
Có ba con đường riêng biệt đến giọng kể chuyện kiểu thì thầm, và chúng khác nhau về công sức, về mức độ cá nhân mà kết quả cảm nhận được, và về khả năng duy trì tốt qua một danh mục dài.
Giọng nhẹ nhàng cài sẵn. Bạn chọn một giọng từ thư viện đã nói nhẹ nhàng sẵn và sử dụng nguyên trạng. Đây là con đường nhanh nhất và là con đường mà hầu hết mọi người nên thử trước, bởi vì việc thử nghiệm nhiều ứng viên với kịch bản thực tế của bạn không tốn gì cả. Thử nghiệm với một đoạn văn có chứa các trường hợp khó — một câu dài, một danh sách, một con số, một danh từ riêng — thay vì một dòng gọn gàng đơn lẻ, vì đó là nơi một giọng hoặc giữ được sự nhẹ nhàng hoặc phá vỡ đặc tính của nó. Hạn chế là danh tính: một giọng cài sẵn nghe giống một giọng hay, không giống bạn.
Giọng được định hình theo cách truyền tải. Ở đây bạn lấy một giọng cơ sở và đẩy nó về phía một tiếng thì thào bằng cách điều chỉnh các phẩm chất định nghĩa lời nói nhẹ nhàng: nhịp độ chậm hơn, năng lượng giảm, hơi thở dài hơn giữa các mệnh đề, sự nhấn mạnh nhẹ nhàng hơn. Việc viết kịch bản cũng làm việc thực sự ở giai đoạn này. Câu ngắn hơn, nhiều dấu phẩy hơn, và các ngắt dòng có chủ ý cho mô hình ngữ điệu những nơi tự nhiên để chậm lại. Một kịch bản được viết cho một video giải thích năng động sẽ chống lại việc thì thầm bất kể cài đặt nào nằm trên nó. Bài kiểm tra thực tế là liệu cùng một kịch bản, được đọc to bởi một người trong một căn phòng yên tĩnh, có nghe tự nhiên ở âm lượng thấp không. Nếu không, văn bản là vấn đề chứ không phải giọng nói.
Bản sao giọng thì thầm tùy chỉnh. Đây là con đường tạo ra một giọng mà không ai khác có. Công cụ Nhân Bản Giọng Nói của chúng tôi xây dựng một giọng tùy chỉnh từ khoảng 20 giây âm thanh, và đặc tính của mẫu đó là những gì bản sao kế thừa. Ghi âm 20 giây giọng nói bình thường của bạn và bạn có được một bản sao giọng nói bình thường của bạn. Ghi âm 20 giây một tiếng thì thầm có chủ ý, gần micro và bản sao mang sự nhẹ nhàng đó vào mọi kịch bản bạn cung cấp cho nó sau đó. Bởi vì bạn có thể tạo nhiều hơn một bản sao, việc giữ một giọng tiêu chuẩn và một nhân vật thì thầm chuyên dụng song song là một cách hợp lý để vận hành một kênh trộn lẫn các định dạng — một đoạn giới thiệu năng động bằng một giọng, phần thân dài thì thào bằng giọng kia.
| Con đường | Danh tính giọng nói | Phù hợp nhất cho | Đánh đổi chính |
|---|---|---|---|
| Giọng nhẹ nhàng cài sẵn | Giọng thư viện | Thử nghiệm nhanh, kể chuyện tiện ích | Không đặc trưng cho thương hiệu của bạn |
| Giọng định hình theo cách truyền tải | Giọng thư viện, được làm mềm | Chuỗi nhất quán với một giọng đã chọn | Phụ thuộc rất nhiều vào nhịp độ kịch bản |
| Bản sao giọng thì thầm tùy chỉnh | Giọng của chính bạn | Kênh sáng tạo, kể chuyện thương hiệu | Chất lượng được xác định bởi mẫu nguồn |
Một lưu ý về bản sao: mẫu xác định giới hạn trên. Hướng dẫn được công bố cùng với quy trình tạo giọng của OpenAI khuyến nghị ghi âm trong một không gian yên tĩnh với tiếng vọng tối thiểu, sử dụng một micro XLR chuyên nghiệp, và giữ khoảng cách nhất quán bảy đến tám inch với nó. Lời khuyên đó nhắm đến việc tạo giọng nói nói chung, và nó áp dụng với lực bổ sung cho việc thì thầm, bởi vì một tiếng thì thầm là một tín hiệu biên độ thấp. Âm phòng, tiếng ù của HVAC, và rung động bàn làm việc mà sẽ ẩn dưới một giọng nói bình thường lại nằm ngay trên một giọng thì thầm. Cùng logic đó phản đối việc xử lý mẫu trước khi bạn gửi nó — giảm nhiễu và nén nặng áp dụng cho một bản ghi mờ nhạt có xu hướng làm nhòe chính xác chi tiết hơi thở khiến tiếng thì thầm được đọc như một tiếng thì thầm.
Tại sao giọng nói nhẹ nhàng quan trọng với người sáng tạo, đội nhóm và nhà phát triển
Kể chuyện nhẹ nhàng không phải là một định dạng mới lạ. Nó neo giữ một số danh mục nội dung bền vững nhất trên các nền tảng video và âm thanh, và mỗi phân khúc khán giả của chúng tôi gặp nó từ một hướng khác nhau.
Đối với những người sáng tạo YouTube, cách truyền tải thì thầm là chữ ký định dạng cho ASMR, nội dung ngủ và trước khi ngủ, thư giãn có hướng dẫn, và bình luận nhẹ nhàng. Đây là những ngách nặng về thời gian xem nơi giọng nói là sản phẩm. Vấn đề lặp đi lặp lại là khối lượng đầu ra: một kênh xuất bản nhiều tác phẩm nói nhẹ dài mỗi tuần đang yêu cầu một cổ họng con người thì thầm hàng giờ, điều thực sự mệt mỏi và không nhất quán qua các buổi. Sự mệt mỏi không chỉ khiến việc ghi âm khó chịu — nó thay đổi âm thanh, bởi vì một tiếng thì thầm mệt mỏi trôi dạt to hơn và thô ráp hơn khi một buổi kéo dài. Một giọng thì thầm được nhân bản đọc tập năm mươi giống hệt cách nó đọc tập một.
Đối với các doanh nghiệp nhỏ và đội ngũ tiếp thị, trường hợp sử dụng yên tĩnh hơn theo một nghĩa khác. Hướng dẫn sản phẩm, phim thương hiệu bình tĩnh, âm thanh môi trường trong cửa hàng, và định vị chăm sóc sức khỏe hoặc chăm sóc bản thân đều hưởng lợi từ việc kể chuyện không la hét. Đặt lịch diễn viên lồng tiếng cho mỗi bản sửa đổi kịch bản là nơi các dự án này thường bị đình trệ, và tổng hợp loại bỏ vấn đề lên lịch khỏi chu kỳ chỉnh sửa. Điều đó quan trọng nhất đối với nội dung thay đổi thường xuyên: các biến thể theo mùa, các tuyên bố miễn trừ trách nhiệm theo khu vực, và các phiên bản A/B của cùng một quảng cáo.
Đối với các nhà sản xuất học trực tuyến và đào tạo doanh nghiệp, kể chuyện nhẹ nhàng giảm mệt mỏi cho người nghe qua các mô-đun dài. Một giọng bình tĩnh cho một khóa học tuân thủ tạo cảm giác khác với một bài đọc quảng cáo sáng sủa, và sự nhất quán qua hàng chục mô-đun dễ giữ hơn với một giọng tổng hợp so với nhiều buổi ghi âm trải dài qua nhiều tháng. Nó cũng làm cho việc bảo trì rẻ: khi một đoạn chính sách thay đổi, bạn tái tạo một đoạn thay vì đặt lại một buổi để khớp với một bản thu từ hai năm trước.
Đối với các nhà làm phim độc lập và người làm podcast, giọng thì thầm là một thủ pháp kịch tính — độc thoại nội tâm, thư được đọc to, các thủ pháp khung hình thân mật. Khả năng lặp lại một bản thu mà không cần gọi lại diễn viên thay đổi cách bạn có thể tự do thử nghiệm trong khâu chỉnh sửa, và nó cho phép bạn kiểm tra một phương án thì thầm so với một phương án trung tính trước khi cam kết cảnh.
Đối với các nhà phát triển và các agency, thuộc tính thú vị là cách truyền tải nhẹ nhàng có thể được tạo ra theo yêu cầu bên trong một sản phẩm. API Chuyển Văn Bản Thành Giọng Nói của chúng tôi hiển thị thư viện giọng nói và khả năng nhân bản một cách lập trình, để một ứng dụng có thể yêu cầu một giọng cụ thể và nhận âm thanh cho văn bản bất kỳ mà không cần con người trong vòng lặp. Một ứng dụng thiền cho phép mỗi người dùng kể chuyện bằng giọng thì thầm của riêng họ là một vấn đề tích hợp, không phải một vấn đề nghiên cứu: ứng dụng thu thập một mẫu ngắn, đăng ký nó như một giọng, và gọi cùng một đường tạo sinh cho mỗi kịch bản buổi sau đó.
Lớp đa ngôn ngữ là nơi nội dung nhẹ nhàng thường bị hỏng nhất, và điều đó đáng nói thẳng ra. Một kênh được xây dựng trên sự thì thầm có một hợp đồng về tông giọng với khán giả của nó. Bản địa hóa nó với một giọng lồng tiếng sáng, vang và hợp đồng bị phá vỡ — lời đúng nhưng cảm giác sai. Công cụ Lồng Tiếng AI của chúng tôi hoạt động qua 33 ngôn ngữ đích từ hơn 60 ngôn ngữ nguồn, và bởi vì nó có thể sử dụng một giọng được nhân bản làm giọng đầu ra, sự nhẹ nhàng và nhịp độ định nghĩa bản gốc có thể mang vào các phiên bản đã dịch thay vì bị đặt lại bởi một bài đọc có sẵn.
Điều cần cân nhắc trước khi bạn cam kết với giọng thì thầm
Đây là một giai đoạn phán đoán, không phải một quy trình. Năm tiêu chí quyết định liệu tổng hợp kiểu thì thầm có duy trì tốt cho dự án cụ thể của bạn không.
Độ dễ hiểu qua các điều kiện phát lại. Âm thanh thì thầm có ít năng lượng hơn và ít hỗ trợ tần số thấp hơn so với lời nói bình thường, nên nó tồn tại tốt hơn nhiều trên tai nghe so với trên loa điện thoại trên xe buýt. Nếu khán giả của bạn nghe trên tai nghe vào ban đêm, bạn có thể đẩy sự nhẹ nhàng. Nếu nội dung của bạn phát trong ô tô, trên TV, hoặc trong văn phòng mở, hãy giữ nhiều độ vang hơn trong cách truyền tải và kỳ vọng quản lý mức âm lượng trong khâu trộn thay vì trong khâu tạo sinh. Một kỷ luật hữu ích là kiểm tra mỗi tác phẩm hoàn thành một lần trên thiết bị tệ nhất mà khán giả của bạn có thể dùng; bất cứ thứ gì sống sót qua bài kiểm tra đó sẽ sống sót qua phần còn lại.
Chất lượng mẫu nguồn, nếu bạn đang nhân bản. Đối với một bản sao thì thầm, đây là biến số có đòn bẩy cao nhất. Phòng yên tĩnh, khoảng cách micro gần và nhất quán, không xử lý trên đường vào, và một mẫu thực sự thì thầm chứ không chỉ nói khẽ. Một kịch bản được đánh bóng với một mẫu bị tổn hại nghe tệ hơn một kịch bản thô sơ với một mẫu sạch, và không lượng tinh chỉnh hạ nguồn nào có thể khôi phục chi tiết chưa bao giờ được ghi lại.
Phạm vi ngôn ngữ. Quyết định sớm liệu tiếng thì thầm có cần là giọng của bạn ở mọi ngôn ngữ hay liệu một giọng nhẹ nhàng nghe bản xứ cho mỗi thị trường có được chấp nhận không. Lồng tiếng dựa trên bản sao bảo toàn danh tính qua các ngôn ngữ; giọng thư viện cho bạn đặc tính giọng bản xứ. Cả hai đều có thể biện hộ được, và lựa chọn định hình cách bạn xây dựng tài sản ngay từ đầu — nếu danh tính là ưu tiên, bản sao phải tồn tại trước khi danh mục tồn tại.
Hình dạng tích hợp. Các đội làm việc hoàn toàn trong giao diện web không cần nghĩ về điều này. Các đội xây dựng một sản phẩm nên quyết định liệu việc tạo sinh xảy ra đồng bộ bên trong một tương tác người dùng hay như các công việc theo lô trên một danh mục, vì điều đó ảnh hưởng đến cách bạn xếp hàng công việc và cách bạn xử lý lỗi. API Lồng Tiếng AI của chúng tôi được xây dựng cho trường hợp theo lô, nơi toàn bộ thư viện chuyển sang ngôn ngữ mới với một giọng đầu ra nhất quán, trong khi các tính năng tương tác có xu hướng ưa chuộng các yêu cầu ngắn được tạo theo yêu cầu.
Sự đồng thuận và tiết lộ. Nhân bản giọng nói chạm đến ngoại hình cá nhân, và nội dung thì thầm thân mật khiến điều đó nhạy cảm hơn chứ không kém đi. Mẫu đồng thuận được công bố cho quy trình tạo giọng của OpenAI là bài học về thực hành ngành: nó yêu cầu một bản ghi đồng thuận cùng với bản ghi mẫu, từ cùng một người nói. Cho dù bất kỳ quy tắc cụ thể nào ràng buộc bạn hay không, việc có được sự cho phép rõ ràng, được ghi lại từ người mà giọng nói được nhân bản là mặc định có thể biện hộ được, và nhân bản giọng của một bên thứ ba mà không có sự cho phép không phải là điều nên thử. Chính sách nền tảng về phương tiện tổng hợp và tiết lộ tiếp tục thay đổi, và các yêu cầu xung quanh ngoại hình giọng nói và dữ liệu sinh trắc học khác nhau theo khu vực pháp lý — đối với một triển khai lớn, hãy xác minh các quy tắc hiện hành áp dụng cho thị trường của bạn thay vì dựa vào một bản tóm tắt chung.
Lựa chọn bước tiếp theo của bạn
Quyết định trước mắt bạn thực sự là một lựa chọn giữa ba cam kết, và cái đúng phụ thuộc vào điều bạn đang bảo vệ.
Nếu bạn đang kiểm tra liệu một định dạng nhẹ nhàng có hoạt động cho khán giả của bạn chút nào không, hãy bắt đầu với một giọng dịu dàng cài sẵn và một kịch bản thực. Bạn sẽ học được nhiều hơn từ một tác phẩm đầy đủ độ dài trong một giọng thư viện so với từ hàng chục lần thử ngắn, bởi vì các phẩm chất làm nên hoặc phá vỡ một bài đọc thì thào — nhịp độ qua mười phút, vị trí hơi thở, liệu tông giọng có trở nên đơn điệu — chỉ xuất hiện khi kéo dài.
Nếu giọng nói chính là thương hiệu — một kênh sáng tạo, một chuỗi dễ nhận biết, một sản phẩm được người sáng lập kể chuyện — thì bản sao thì thầm là tài sản đáng xây dựng, và buổi ghi âm tạo ra mẫu xứng đáng được chăm sóc thực sự. Đó là một buổi ngắn quyết định âm thanh của mọi thứ bạn xuất bản sau đó.
Nếu bạn đã có một danh mục nói nhẹ và câu hỏi tăng trưởng là địa lý, công việc là lồng tiếng với danh tính giọng nói được bảo toàn, để sự bình tĩnh bạn xây dựng ở một ngôn ngữ sống sót qua bản dịch sang ngôn ngữ tiếp theo.
Không chắc cái nào trong ba cái phù hợp? Hãy cho chúng tôi biết định dạng, các ngôn ngữ bạn đang nhắm đến, và đại khái bao nhiêu nội dung bạn kỳ vọng sản xuất mỗi tháng, và chúng tôi sẽ ánh xạ nó tới sự kết hợp đúng của Chuyển Văn Bản Thành Giọng Nói, Nhân Bản Giọng Nói và Lồng Tiếng AI trước khi bạn cam kết bất kỳ thời gian sản xuất nào cho nó.
Câu hỏi thường gặp
Chuyển văn bản thành giọng nói kiểu thì thầm có giống với OpenAI Whisper không?
Không. OpenAI Whisper là một mô hình nhận dạng giọng nói tự động chuyển đổi âm thanh thành văn bản, được huấn luyện trên 680.000 giờ âm thanh đa ngôn ngữ và được sử dụng để phiên âm và dịch sang tiếng Anh. Chuyển văn bản thành giọng nói kiểu thì thầm hoạt động theo hướng ngược lại: nó chuyển đổi văn bản viết thành âm thanh nói được truyền tải theo phong cách nhẹ nhàng, đầy hơi thở. Cùng từ, ngược nhiệm vụ. Hệ quả thực tế là bạn sẽ không tìm thấy một giọng thì thầm bên trong một sản phẩm phiên âm, bởi vì sản phẩm đó hoàn toàn không có đầu ra giọng nói.
Tôi có thể nhân bản giọng thì thầm của chính mình không?
Có. Công cụ Nhân Bản Giọng Nói của chúng tôi tạo một giọng tùy chỉnh từ khoảng 20 giây âm thanh, và bản sao phản ánh đặc tính của bất cứ thứ gì bạn ghi âm. Cung cấp một mẫu thì thầm và giọng kết quả đọc các kịch bản theo phong cách thì thào đó; cung cấp một mẫu nói bình thường và bạn có được một giọng bình thường, bất kể kịch bản được viết thế nào. Bạn có thể duy trì nhiều bản sao, vì vậy một giọng tiêu chuẩn và một nhân vật thì thầm có thể cùng tồn tại trên cùng một tài khoản và được chọn theo dự án.
Một giọng AI thì thầm có còn dễ hiểu trên điện thoại và TV không?
Điều đó phụ thuộc vào việc bạn đẩy sự nhẹ nhàng đến mức nào và cách bạn trộn âm thanh cuối cùng. Lời nói thì thầm mang ít năng lượng hơn lời nói bình thường, nên nó duy trì tốt nhất trên tai nghe và có thể mất chi tiết trên loa nhỏ trong môi trường ồn ào. Giữ một chút độ vang trong cách truyền tải, tránh nền nhạc nặng, và đặt mức âm lượng cho điều kiện phát lại tệ nhất có thể đều giúp ích. Nếu hầu hết khán giả của bạn nghe trên tai nghe, bạn có nhiều không gian hơn nhiều để nghiêng vào tiếng thì thào so với một kênh được xem trên TV phòng khách.
Một giọng nhẹ nhàng có thể được mang sang các ngôn ngữ khác không?
Có. Công cụ Lồng Tiếng AI của chúng tôi bản địa hóa nội dung sang 33 ngôn ngữ đích từ hơn 60 ngôn ngữ nguồn, và nó có thể sử dụng một giọng được nhân bản làm giọng đầu ra lồng tiếng. Đó là cách nhịp độ và tông giọng của một bản gốc nói nhẹ vẫn có thể nhận ra trong các phiên bản đã dịch thay vì bị thay thế bởi một bài đọc có sẵn to hơn. Phương án thay thế — một giọng nhẹ nhàng bản xứ được chọn theo thị trường — cũng hợp lý nếu đặc tính giọng bản xứ địa phương quan trọng với bạn hơn việc giữ một giọng dễ nhận biết ở mọi nơi.
Tôi có cần thiết bị phòng thu để ghi một mẫu thì thầm tốt không?
Một phòng thu không bắt buộc, nhưng môi trường ghi âm quan trọng đối với việc thì thầm hơn so với lời nói bình thường. Hướng dẫn được công bố về việc tạo giọng nói khuyến nghị một không gian yên tĩnh với tiếng vọng tối thiểu, một micro XLR chuyên nghiệp, và khoảng cách micro nhất quán bảy đến tám inch. Một căn phòng yên tĩnh và một micro tốt sẽ mang lại cho hầu hết mọi người một mẫu sạch; một căn phòng ồn ào thì không, bởi vì mức nền nhiễu nằm gần chính tiếng thì thầm. Đồ nội thất mềm, thời điểm trong ngày ít xe cộ bên ngoài, và tắt hệ thống thông gió thường làm được nhiều cho kết quả hơn là nâng cấp phần cứng.
Xuất bản kể chuyện thì thầm tổng hợp có được cho phép trên các nền tảng video không?
Các nền tảng lớn cho phép giọng tổng hợp trong nội dung trong khi duy trì các quy tắc đang phát triển về tiết lộ, mạo danh, và phương tiện tổng hợp nói chung. Những chính sách đó thay đổi và khác nhau theo nền tảng, vì vậy hãy kiểm tra các điều khoản hiện hành cho bất cứ nơi nào bạn xuất bản. Là một cơ sở, chỉ nhân bản các giọng mà bạn có tài liệu cho phép sử dụng, và cân nhắc nêu rõ trong mô tả hoặc thông tin kênh của bạn rằng phần kể chuyện là tổng hợp nếu khán giả của bạn có thể hợp lý kỳ vọng một giọng con người.
