Bạn có thể thấy tầm quan yếu của công nghệ chuyển đổi văn bản thành giọng nói bằng cách quan sát các kỹ sư làm việc. Trong một bức thư gửi cho các cổ đông vào tháng Mười Một năm ngoái, CEO của Microsoft Steve Ballmer đã nhấn mạnh tầm quan trọng của việc "diễn giải tiếng nói tự nhiên và học qua máy móc", hay những trí sáng dạ nhân tạo sử dụng lời nói. Trong khi ngành công nghệ cao rất lạc quan về ngày mai của giọng nói điện tử, ngạc nhiên thay lại có một số người không ưa lắm với cảnh xa này, đó chính là những diễn viên lồng tiếng. Đúng vậy, chính là những người cung cấp nguyên liệu thô cho ngành công nghiệp này. Lý do có nhẽ chỉ là bởi họ không hiểu rõ về những tác động mà nó mang lại. dù rằng vẫn có những người, như September Day hay Allison Dufty – một cựu diễn viên lồng tiếng của Nuance, người sẵn sàng công khai mọi thông báo về công việc của mình, nhưng những người đó rất hiếm. nền móng NDAs đã ngăn cách các diễn viên có thể gắn liền tăm tiếng của mình với một thương hiệu nhất quyết. Những đại lý có mối quan hệ với các công ty công nghệ trong ngành thường úp úp mở mở nhằm giữ được lợi thế cạnh tranh của mình. Và trong bối cảnh thiếu thốn thông báo, sự hoang tưởng ngự trị. "Trong ngành của mình, chúng tôi coi công nghệ chuyển đổi văn bản thành giọng nói (text to speech – TTS) là một mối đe dọa" – theo giám đốc marketing của trang web Voices.com, Stephanie Ciccarelli – "Họ nghĩ rằng nó sẽ thay thế những diễn viên lồng tiếng". Một email được gửi tới một diễn viên lồng tiếng rất thành công, người từng làm việc cho các công ty như Wells Fargo, NPR, AT&T, đã nhận được một câu trả lời lịch sự nhưng kiên quyết: "Điều duy nhất tôi có thể nói về quan điểm của các diễn viên lồng tiếng về TTS là họ nghĩ nó khá đáng ghét … có nhẽ một ngày nào đó nó sẽ đạt tầm của những bộ phim 3D bây giờ, nhưng giờ nó chẳng khác nào một trò đùa". Trở lại với Nuance, Ward và Vazquez đang rất phấn khởi với việc thí điểm công nghệ mới mà họ đang nghiên cứu. Ward giải thích rằng Nuance có thể phối hợp âm thanh tổng hợp và âm thanh nối, và làm cho chúng trở thành tự nhiên, và sớm thôi, chúng sẽ có thể giúp cho bít tất các giọng nói tổng hợp trở nên dễ nghe. Sức mạnh của máy photocopy đã đạt đến độ có thể tạo ra một giọng nói hoàn toàn tự nhiên, không có một tẹo robot nào. Giao dịch với máy móc: Chuyện không còn xa vời "Nhưng giờ mọi thứ vẫn phụ thuộc vào giọng nói của người thật" – Ward nói. Kể cả một giọng nói tổng hợp cũng cần một khuôn mẫu để bắt chước. Một ngày nọ, Ward và Vazquez đã thí nghiệm một sự phối hợp giữa một chiếc máy photocopy toshiba cũ với một chiếc máy phát nhạc sáng dạ: Chương trình có thể nhận ra bản tin mà nó đang đọc là vui hay buồn, và từ đó chọn lọc một bản nhạc phù hợp để làm nền, tạo cho người nghe một cảm giác trung thực. Họ bám chặt lấy ý tưởng về một ngày nào đó, chúng ta có thể được nghe bản tin bằng giọng của chính người viết, hoặc có thể về nhà và nói "là tôi đây" để điều chỉnh nhiệt độ theo ý mình, bằng cách dùng phần mềm nhận dạng giọng nói và trí sáng dạ nhân tạo. "Đúng vậy. Anh có thể dùng phần mềm nhận dạng giọng nói để máy móc tự phun ra một loại hóa chất, và vợ anh sẽ không biết anh vừa hút thuốc" – Ward nói. Bỏ qua những câu chuyện bông đùa qua một bên, viễn tượng này không còn quá xa vời, nhất là khi xét đến sự tồn tại của công nghệ nhà thông minh như Nest, một phần mềm có thể ghi nhớ nhiệt độ mà bạn mong muốn, và điều chỉnh nhiệt độ trong nhà khi bạn đi và về. Nhưng kể cả những giọng đọc hay cũng chưa chắc được bằng lòng (nhiều người đích thực rất ghét nghe giọng của chính mình). Dù vậy, vẫn còn những hứa về việc tạo những giọng nói tổng hợp tốt hơn, cho phép chúng ta có được sự giao dịch hoàn thiện hơn với máy photocopy e studio 523. "Rất dễ dàng để hiểu được Siri, nhưng cái chúng ta vẫn cần là phần mềm này có thể truyền tải cảm xúc và tính cách như con người" – theo Benjamin Munson, một giáo sư về lĩnh vực tiếng nói tại Đại học Minnesota. Ở mức tối thiểu, ông nói, sẽ rất tuyệt nếu như những phần mềm như Siri hiểu được tâm trạng của người dùng và có phản hồi thích hợp, như cách một người có thể nhẹ nhõm đáp lại trước thái độ tức giận của khách hàng. Theo Munson, thứ được gọi là "tiếng nói không lời" mà chúng ta sử dụng đó rất khó để đưa vào công nghệ, nhưng ông nhấn mạnh rằng có nhiều nhà nghiên cứu đã bắt đầu tìm hiểu về vấn đề này. giao du với máy móc: Chuyện không còn xa vời "Khi tôi bắt đầu bước vào ngành này, phần lớn thị trường giọng nói tổng hợp là dành cho những hệ thống giải đáp thư thoại tự động, và ý tưởng về việc tạo ra một giọng nói có thể truyền tải được cảm xúc và nhân cách không hề được quan tâm đến" – theo Matthew Aylett, giám đốc của công ty CereProc – "sau hết thì, bạn không hề muốn ngân hàng thông báo số dư tài khoản của mình với một giọng não nuột trong khi mà bạn đang không có nhiều tiền". Giờ đây, khi mà giọng nói tổng hợp được dùng để đọc blog, thậm chí toàn bộ cuốn sách Kindle, thông báo thời gian biểu, hay nhắc bạn về thăm bà, hoặc đơn giản là nhắc các mốc thời kì làm việc trong ngày tại công ty, thì có lẽ đã đến lúc đổi thay. "Người máy R2D2 trong phim Star War luôn là robot yêu thích của tôi" – Aylett nói – "Nó vẫn nói giống như một robot, nhưng lại biểu hiện được tính cách, cảm xúc và sự chế giễu. Chúng tôi cũng đang cố gắng làm được như vậy". Adam Wayment san sẻ rằng, ông đã từng trò chuyện với một khách hàng khiếm thị, và anh ta nói rằng: "Anh có biết sử dụng một chiếc lò vi sóng khó khăn như thế nào không? Khi mà mỗi loại lại có cách bài trí riêng?". Điều này làm Wayment nảy ra ý tưởng về một thế giới toàn những chiếc lò vi sóng biết nói. Ông nói một cách trang nghiêm: "Tôi nghĩ rằng ngày đó đang tới, khi mà một thiết bị nhỏ cũng có thể nói được, nhưng chúng ta đang mạo hiểm lấp đầy cuộc sống của mình với những âm thanh. Chỉ những thiết bị biết nói thôi là không đủ, chúng phải nói cho chúng ta biết thứ mà chúng ta cần và thứ mà chúng ta muốn biết. Chúng phải có nội tâm". Và nếu mọi thứ không được như vậy, chúng ta có thể nghĩ tới một ngành kinh doanh tiềm năng khác: nhạc điệu của sự im lặng!