Síntesis de la palabra hablada para el uso de la IA

Casi todos los sistemas de identificación de la voz dependen o están ajustados a la voz del locutor, es decir, identifican las palabras pronunciadas por una misma persona. Por tanto, la persona debe pronunciar primero cada palabra del vocabulario requerido para que el sistema genere las plantillas de referencia. Cuanto mayor es el vocabulario, mayor es la memoria que precisa el ordenador. Desarrolladas las plantillas, el locutor profiere una palabra: el sistema informático 1a “”escucha” a través de un micrófono. la convierte en impulsos y hace referencia a la plantilla almacenada para esa palabra y responde acordemente cuando encuentra una coincidencia entre entrada y plantilla. La técnica de codificación predictiva lineal (LPC: lnear predictiva coding) ha sido desarrollada como un sistema de análisis matemático para simplificar el almacenamiento de las plantillas y ahorrando una significativa cantidad de memoria. También se puede usar análisis de características para almacenar características fonéticas en vez de formas de onda.

Para simplificar las tareas de identificación de la voz y comprensión del lenguaje, se pueden utilizar muchos elementos del discurso. Hasta ahora hemos mencionado la fonética, la sintaxis, y la semántica. Pero también podemos considerar la fonética (cambios de pronunciación), la morfología (combinación de morfemas para formar palabras, plurales, conjugaciones, etc.), la prosodia (cambios de entonación) y la pragmática (la influencia de las intenciones del locutor sobre la conversación). Además, hay que guardar la información relevante, no sólo de las plantillas, sino también del campo específico de conocimientos usado, sin el cual el ordenador no podría comprender semánticamente.

Los diferentes programas de investigación práctica y teórica han generado una amplia gama de productos prácticos. Por ejemplo, Nippon Electricity Company lanzó en 1978 su Voice Data Input Terminal, un dispositivo capaz de identificar hasta 120 palabras habladas seguida-mente en grupos de cinco. Threshold Technology Inc introdujo en 1976sus unidades de reconocimiento de voz. En 1980, en el Centro de Investigación de IBM en Yorktown Heights se utilizaba un ordenador para transcribir frases habladas de un vocabulario de 1000 palabras (a velocidad normal de lectura se apreció una precisión del 91 %). En la misma fecha Scott Instruments presentaba su Vet-1, un terminal de entrada por voz que fue seguido por el Vet-2 de mejores prestaciones. Otras empresas que han lanzado unidades de reconocimiento de voz son: Interstate Electronics, Auricle, Voicetek, Texas Instruments. Centrigram, etc. Iverson (1982) evalúa las características de software de estos sistemas. Se pueden encontrar instalaciones de reconocimiento de voz en las salas de control industrial, en los aviones de alta velocidad en las fábricas y en las oficinas. El desarrollo de sistemas de identificación de voz Independientes del Interlocutor y con vocabularios más extensos acercará el día en que la entrada y salida por voz será algo común en las interfases de ordenador. Medical Comunication Corporation. por ejemplo, ha desarrollado un sistema basado en microordenador capaz de identificar hasta 25.000 palabras. Este diseño reduce la cantidad de memoria necesaria para identificar una palabra, aumentando. en consecuencia, el número de vocablos almacenable en el mismo espacio de memoria. Este tipo de producto puede tener muchísimas aplicaciones.

Voice Input, el distribuidor en Gran Bretaña de la compañía americana Votan, ha introducido un sistema de identificación de voz independiente del locutor. Aunque el dispositivo tiene en alcance muy limitado, apunta posibilidades de que los ordenadores comprendan todo lo que se les diga. IBM y Hewlett-Packard ofrecen actualmente una gama comercial de dispositivos de entrada por voz, una línea que se ampliará en el futuro. Una media docena de grandes empresas de telecomunicación ha demostrado equipos que siguen instrucciones habladas. Un dispositivo de NEC comprende expresiones habladas congruentes, y puede traducir entre japonés, inglés y español. La investigación en Al sobre sistema de identificación de voz y comprensión del lenguaje ha conducido a un amplio espectro de productos funcionales. Algo muy significativo dado que la filosofía lingüística es un tema muy debatido. No existe consenso sobre la interpretación del uso y comprensión del lenguaje en los seres humanos, sin embargo, los sistemas artificiales están desarrollando rápidamente sus recursos de lenguaje.

Las instalaciones de síntesis de la palabra hablada pueden complementar unidades de reconocimiento de voz o pueden funcionar autónomamente (las empresas interesadas en máquinas con capacidad parlante desean tanto entrada como salida aural). Un sistema de síntesis aural puede dar una alarma oral, si se produce una situación de emergencia en un entorno industrial, o señalar situacıones de peligro en otros tipos de ambiente. Por ejemplo, McDonnell-Douglas Corporation ha diseñado un Sistema Aural de Alarma en Cabina mediante síntesis hablada microcontrolador. Las Instalaciones de síntesis de la palabra hablada encuentran aplicación en oficinas. automóviles, hogar, juguetes, juegos, etc.