martes, mayo 25, 2010

Detector "semiautomático" del sarcasmo

Y siguiendo con el tema del análisis de opiniones, aquí os dejo esta noticia publicada en La Vanguardia el pasado 21 de mayo sobre un "detector de sarcasmo", también conocido como SASI (Algoritmo Semi Supervisado para la Identificación del Sarcasmo).

Si incluso a los humanos nos cuesta pillar las ironías y los sarcasmos de otros... ¿será capaz de identificarlos una máquina? Permitidme que lo ponga en duda...

Gracias, Nerea ;-)

Más sobre "análisis de sentimientos y minería de opiniones"

El 24 de septiembre de 2010 tendrá lugar en Barcelona una "sesión especial sobre análisis de sentimientos y minería de opiniones" dentro del taller DyNaK del congreso ECML PKDD 2010.

Aquí os dejo algunos datos más sobre el encuentro. Como podéis comprobar, ¡éste es un tema cada día más de moda!

Motivación
A diario, millones de personas escriben sus opiniones sobre cualquier tema en distintos medios como blogs, sitios de noticias o redes sociales. La obtención de conocimiento desde esta ingente cantidad de información supone un reto que implica a varias disciplinas científicas. El análisis de sentimientos y la minería de opiniones son dos tareas relacionadas con el procesamiento del lenguaje natural y la minería de textos que tienen como principal objetivo la identificación de opiniones y actitudes en textos escritos en lenguaje natural. En esta sesión especial interesan resultados, tanto académicos como empresariales, obtenidos en el campo de la extracción de conocimiento desde contenidos generados por usuarios, y cómo afecta el aspecto temporal en estas tareas.

Temas de interés de la sesión
- Extracción y clasificación de opiniones
- Análisis de blogs y redes sociales
- Aspecto temporal del análisis de sentimientos
- Detección de plagios e ironía en textos de opinión
- Sistemas de recomendación

Ponencia invitada
"How much linguistics do we need in order to understand online opinions?" a cargo de Carlos G. Rodríguez Penagos, de Barcelona Media.

Información obtenida a través de la lista de distribución l-red-timm.

lunes, mayo 17, 2010

Euskera añadido a la traducción web de este blog

Dado que el par español-euskera ya está disponible en GoogleT, lo he añadido a la opción de traducción web de este blog, para que podáis seguir haciendo pruebas :-)

Es curioso que el "Veamos" que inicia la descripción que se ubica bajo el título lo traduce bien. Será que aparece muchas veces en sus corpus de entrenamiento...

El traductor de Google y el euskera (I)

El viernes 14 de mayo, el sistema de traducción automática de Google activó cinco nuevos pares de lenguas en versión "alpha": armenio, azerí, georgiano, urdu y euskera.

Tal y como transmitieron en su blog, son ya 57 las lenguas con las que trabaja este sistema, y subiendo...

Así que en este post me gustaría hacer un pequeño análisis de los resultados que ofrece la traducción español-euskera de GoogleT (dejaremos el inverso y la combinación con otras lenguas para más adelante) y comparar estos resultados con los de los otros dos traductores automáticos disponibles actualmente en la red: Opentrad y el sistema del Instituto Cervantes, ambos considerados también un prototipo.

Vayamos por partes y por hitos lingüísticos. De momento, he seleccionado únicamente un par de casuísticas para no saturar el post.

Saludos, despedidas y expresiones de cortesía

Comenzaremos por un caso práctico que podría servir para iniciar o terminar un correo electrónico dirigido a un euskaldun. Para ello, he escogido tres ejemplos, en orden creciente de formalismo:

a) Hola, ¡cuánto tiempo! ¿Cómo estás?
GoogleT: Kaixo, zenbat denbora! Zer moduz zaude?
Opentrad: Kaixo, zenbat denbora ¡ !, ¿ nola egon ?
IC: Kaixo, aspaldiko! Zer moduz?
Traducción correcta: Kaixo, aspaldiko! Zer moduz (zaude)?

b) Buenos días / Buenos días María / Buenas tardes / Buenas noches (4 traducciones)
GoogleT: Egun on / Egunon María / Arratsalde on / Good night
Opentrad: Egun onak / Maria egun onak / Arratsalde onak / Gabon
IC: Egun on / Egun on María / Arratsalde on / Gabon
Traducción correcta: Egun on / Arratsalde on / Gabon

c) A la espera de tus noticias, recibe un cordial saludo
GoogleT: zure erantzuna zain, agur bero bat jaso
Opentrad: Zure erantzunaren zain, bihotzeko bat hartzen du agur egiten dut
IC: Zure erantzuna zain, jasotzen du agur bero bat
Traducción correcta: Zure erantzunaren zain, agur bero bat

Oraciones simples

A continuación, seguiremos la prueba con algunas oraciones simples (sujeto - verbo - objeto) tomadas de elcorreo.com.

a) Isidro Elezgarai será el pregonero de la Aste Nagusia
GoogleT: Isidro Elezgarai Aste Nagusia de heraldo da
Opentrad: Isidro Elezgarai Aste nagusiaren pregonaria izango da
IC: Isidro Elezgarai Aste Nagusiaren pregoilaria izango da
Traducción correcta: Isidro Elezgarai Aste Nagusiaren pregoilaria izango da

b) El presidente del Gobierno defiende las reformas anunciadas
GoogleT: Gobernuko presidenteak defendatu du erreforma iragarri du
Opentrad: Gobiernoren presidenteak erreforma iragarriak defendatzen ditu
IC: Gobernuko presidenteak zerbaiten berri emandako erreformak dfendatzen ditu
Traducción correcta: Gobernuko presidenteak iragarritako erreformak defendatu ditu

Conclusiones
Dejando de lado los resultados de Opentrad y el sistema del Instituto Cervantes (que en esta prueba ha salido bastante bien parado) veamos qué se podría deducir del funcionamiento de GoogleT en su traducción español-euskera:
  1. No ajusta bien las mayúsculas de inicio de frase cuando desparece la primera palabra de la oración original (zure erantzunaren zain...)
  2. Sufre bastante carencias en su diccionario: confusiones y falta de cohesión léxicas y gramaticales ("egun on / egunon", pregonero-heraldo, anunciadas, Aste Nagusia), y cuando no dispone de la equivalencia completa de un término en su diccionario (recordemos que GoogleT pivota siempre sobre el inglés) lo dejan en inglés, como en "Buenas noches = Good night".
  3. Sintácticamente, no se ajusta al orden "sujeto - objeto - verbo" paradigmático del euskera
  4. Por otro lado, es el único sistema que convierte correctamente (para este caso al menos) el presente histórico del español a pasado, uso muy frecuente en el lenguaje periodístico actual
  5. Y ya no he continuado con ejemplos más complejos (coordinación, subordinación, preposiciones polisémicas...) porque los resultados dejaban demasiado que desear...
En resumen, aún le queda mucho por aprender a este nuevo sistema. Veamos a qué velocidad avanza y si los corpus que utiliza para su aprendizaje le aportan la calidad de conocimiento necesaria para poder mejorar. Intentaré realizar pruebas periódicas de este sistema para que podamos dar cuenta real su evolución.

Y aunque no venga al caso, yo me sigo preguntando... ¿dónde está el traductor automático del Gobierno Vasco?

jueves, mayo 13, 2010

Análisis lingüístico y redes sociales

Hace unos días publiqué una entrada sobre el primer taller sobre aproximaciones computacionales a la subjetividad y al análisis de sentimientos (WASSA 2010).

Ahora, vía Buscarama leo una noticia sobre las aplicaciones prácticas de este tipo de aproximaciones: informes sobre la opinión de los votantes del Reino Unido sobre sus candidatos a Primer Ministro creados a partir de los comentarios "twitteados" durante el primer debate de la campaña.

Un ejemplo precioso de cómo la interacción entre análisis lingüístico (especialmente semántico) y redes sociales puede ofrecer resultados de interés general.

Para más información, podéis leer el post de Buscarama: Brown, Cameron, Clegg y Twitter.

Los guiones parentéticos

Los guiones parentéticos son aquellos que, en lenguas como el castellano, se utilizan para introducir incisos en el discurso simulando los paréntesis.

En las II Jornades d'Edició Digital Independent se mencionaron estos guiones porque el formato ePub, formato estándar para la publicación de libros electrónicos, aún no consigue tratarlos bien.

Me resultó curioso el comentario, que provino de José Antonio Millán, porque durante mi colaboración en el desarrollo de traductores automáticos en la empresa AutomaticTrans de Barcelona éste era uno de los aspectos más conflictivos para el sistema de traducción dentro del tratamiento de los signos de puntuación.

Así pues, tanto para la tecnología como para los humanos, la lengua se nos revela compleja en todos sus niveles, desde el ortotipográfico hasta el semántico y pragmático, y está claro que sus problemáticas lo son en cualquier ámbito, desde la "simple" edición hasta la traducción.

¡Pero qué bonita que es la lengua!

martes, mayo 11, 2010

Crónica de las "II Jornades d'Edició Digital Independent"

Hoy, 11 de mayo de 2010, he tenido la suerte de poder asistir a las II Jornades d'Edició digital independent en el Institut d'Estudis Catalans. Aquí va un pequeño resumen de las ideas transmitidas.

En primer lugar, José Antonio Millán, autor del blog Libros y bitios (enlazado también como referencia de lectura en este blog) ha presentado un completo "ecosistema del libro digital", realizando un recorrido muy interesante por conceptos sociológicos, tecnológicos y de mercado relacionados con la edición digital.

Los materiales de su presentación recogen interesantes datos en torno al reto que supone este nuevo modelo de edición, desde el aluvión actual de publicaciones hasta los nuevos modelos de lectores, intermediarios, soportes e, incluso, autores. Diversidad y coexistencia de modelos como ideas de base.

En el momento de preguntas y respuestas, y aprovechando el carácter introductorio de la conferencia, varios asistentes se han lanzado con comentarios e inquietudes en torno a aspectos como la piratería, las licencias de los programas de uso privativo o los complejos de los editores para hacer uso de los nuevos recursos tecnológicos. Todo ello ha servido para completar aún más el primer momento de la mañana.

Tras esta intervención, la editora del blog Beat.cat, Iolanda Bethencourt, ha expuesto un concienzudo repertorio de datos sobre conceptos, formatos, aspectos técnicos, plataformas distribuidoras e incluso aspectos legales de los e-books/e-readers.

Ya tras el café tardío, Arantxa Mellado, directora de la red social Ediciona nos ha dejado más que patente la apabullante realidad de la web 2.0, y se ha centrado en modelos de uso de las redes sociales como estrategias de marketing en el ámbito de la edición, con decenas de casos de éxito a modo de ejemplo. Sus mensajes y consejos, claros y directos:
  • Seducir e implicar a los lectores
  • Implicar a los autores
  • Aprovechar la viralidad de la web 2.0
  • Utilizar y experimentar con los nuevos medios hasta encontrar el más efectivo para cada caso

Para cerrar la jornada, la profesora de la UB Laura Borràs nos ha deleitado -acompañada por su iPad y su Papyre 6.S Alex- con la conferencia "Llegir (en) el futur: e-books i canvis en l'escriptura, la lectura i el futur de l'edició". Un arrollador discurso compuesto por un vínculo constante de conceptos humanísticos y tecnológicos relacionados con la "innovación" (que no siempre es innovación, según ella) en escritura, lectura y edición. Una sabrosa disertación para cerrar la jornada con el mejor sabor de boca.

Una mañana realmente completa.

miércoles, abril 28, 2010

Otro "bonito" ejemplo que parece sacado de un traductor automático...

...y que refleja el problema de las homografías y términos multicategoriales. Si así fuera, la postedición debería ser un requisito obligado para cualquier publicación de resultados de sistemas de TA, sea en el medio que sea.

En el blog lafragua tenéis el caso.

No obstante, ni Google Traductor, ni el sistema del Instituto Cervantes, ni el de Lucy Software, ni Babel Fish, que si no me equivoco utiliza Systran para alguno (si no todos) de sus pares de lenguas, ni Opentrad ofrecen este resultado. ¿Será que un humano también puede sucumbir a las ambigüedades categoriales de la lengua?

  • Google Traductor:
    1. Español: Conservas: Delicias del mar
    2. Inglés: Canned: Sea Delights

  • Instituto Cervantes:
    1. Español: Conservas: Delicias del mar
    2. Inglés: Conserves: Delicias of the sea

  • Lucy Software:
    1. Español: Conservas: Delicias del mar
    2. Inglés: Preserves: Delights of the sea

  • Babel Fish / Systran:
    1. Español: Conservas: Delicias del mar
    2. Inglés: Conserves: Delights of the sea

  • Opentrad:
    1. Español: Conservas: Delicias del mar
    2. Inglés: Conserves: Delights of the sea

Curioso también que sólo las dos últimas traducciones coincidan...

Concurso de Literatura Multimedia Bubok

Bubok, empresa dedicada a la publicación de libros electrónicos, ha convocado su I Concurso de Literatura Multimedia.

Al enterarme de la noticia por medio de su blog y leer las bases del concurso un alud de ideas de fusión de tópicos literarios y tópicos digitales arrasaron mi mente: interacción entre redes sociales, elementos multimedia, aplicaciones de web 2.0, de web semántica, opciones de creación individual y/o colaborativa...

Y entonces recordé que hace poco descubrí en Libros y bitios un bonito ejemplo, no de creación literaria, pero sí de innovación de presentación y soporte: La fábula del cuervo huidizo, de La Fontaine, que me resultó realmente inspirador y, sobre todo, realmente original.

Ambas propuestas, tanto la de creación de literatura multimedia como la de adaptación a los nuevos medios de obras consagradas me resultan realmente sugerentes y con unas posibilidades infinitas.

Afortunadamente, aún nos queda mucho por inventar :-)

La molesta barra de traducción automática de Google...

No creo ser la única que ha tenido que enfrentarse al último regalo de Google instalado en su navegador: la barra de traducción automática para páginas web. He de reconocer que las aplicaciones de Google me encantan y soy una fan de su sistema de traducción automática. No obstante, creo que en esta ocasión han menospreciado al usuario.

En el mundo cada vez más multilingüe en el que vivimos, no sólo las aplicaciones, las empresas o las páginas web se manifiestan en diferentes idiomas, también las personas hemos experimentado ese cambio y cada vez son (somos) más loas bilingües, trilingües o incluso políglotas.

Así, dejando de lado aspectos más técnicos como su interferencia en la navegación o la dificultad para desinstalarla, creo que desde Google deberían tener en cuenta un aspecto más en la mejora de su barra de traducción: las lenguas que conoce de antemano el internauta y de las que no necesitará traducción en ningún caso.

Un pequeño formulario tras la instalación de la barra informando al usuario de la nueva actualización y solicitándole que indique en qué lenguas no desea que se aplique este servicio podría resultar realmente agradable al navegante que, cuando "surfee" por una página en una lengua que conoce seguirá disfrutando tan ricamente de su contenido, y cuando acceda a una página en bielorruso automáticamente se le ofrecerá traducción gratuita.

Si eres de los que aún luchas cada día con esta barra teniendo que desactivar la opción de traducción al visitar una página nueva en otra lengua, la información que recoge a este respecto el Foro de ayuda de Google te podrá ayudar.

1st Workshop on Computational Approaches to Subjectivity and Sentiment Analysis

Primer taller sobre aproximaciones computacionales a la subjetividad y al análisis de sentimientos (WASSA 2010).

Parece ser que una de las aplicaciones prácticas del PLN más de moda en la actualidad es la de analizar opiniones, pareceres y sentimientos a través de los elementos que conforman el discurso escrito de los internautas.

Por lo que leo en la descripción del encuentro, las aportaciones que se esperan para el taller irán en la siguiente línea:
  1. Recuperación y organización de la información pertinente para el objeto de estudio
  2. Análisis computacional pragmático y semántico de los elementos lingüísticos que puedan manifestar opiniones subjetivas y sentimientos, ayudándose, incluso, de las aplicaciones de la web semántica
  3. Creación de amplios córpora estructurados y anotados (lingüística de corpus) que aporten datos fiables a los sistemas de minería textual de opiniones.
Es decir, un claro ejemplo de interacción de diferentes técnicas que conforman el actual panorama de la ingeniería lingüística para la obtención de resultados orientados a aplicaciones prácticas.

Estaremos al tanto de los resultados que se obtengan, y confiemos en que sean buenos, pues a más de uno le convendría un buen análisis objetivo de los sentimientos y opiniones que se manifiestan en sus discursos...

martes, abril 27, 2010

Y la vida siguió...

...como siguen las cosas que no tienen mucho sentido. Y casi cinco años después, la tecnofilología volvió a despertar. Esperemos que esta vez no se apague la llama tan pronto.

viernes, octubre 28, 2005

OESI: Portal de Tecnologías Lingüísticas

OESI, la Oficina de Español en la Sociedad de la Información del Instituto Cervantes, posee un completo portal que recoge todo tipo de información internacional acerca de tecnologías lingüísticas: proyectos, investigaciones, congresos, jornadas... "El portal de las Tecnologías Lingüísticas en España". Seguro que lo conocíais, pero por si no, lo podéis encontrar en... http://oesi.cervantes.es

miércoles, abril 13, 2005

Una wikinovela

Al comenzar este post mi intención era emplear el título "La Wikinovela", pero me he visto obligada a cambiar el artículo determinado, indicador en muchos casos de unicidad, por uno indeterminado, ya que "La Wikinovela", de la que pensaba hablaros, no es la única. Con una simple búsqueda en esta inmensa red de contenidos he descubierto una par de proyectos -no institucionales- que comparten una idea muy loable y muy de moda: la escritura cooperativa. Los wikis (wiki wiki significa "rápido" en la lengua hawaiana) pretenden impulsar el trabajo colaborativo, el respeto al texto ajeno y la inmediata difusión de contenidos. Estos objetivos son, precisamente, los que persigue La Wikinovela bilingüe que van a componer los alumnos de la asignatura Literatura y Nuevas Tecnologías de la Universidad de Deusto. La dirección aún no puedo hacerla pública ya que que faltan algunos detalles por ultimar en el proyecto, pero me comprometo a informaros sobre ella en cuanto me sea posible. Fdo: Una wikinovelista.

Il Risorgimento

He vuelto. Aquellos que mejor me conocéis sabéis de sobra que estas idas y venidas son frecuentes en mi vida, así que... que nadie se asuste, aunque desaparezca permanezco. Y como prueba de ello, un par de nuevas. Que no se diga que mi ausencia no ha servido para nada...

domingo, febrero 27, 2005

Quién pudiera...

1er FORO DE EDICIÓN DIGITAL. México, 3 y 4 de marzo de 2005.
Desde hace poco más de un lustro, el trabajo de edición ha encontrado un nuevo territorio donde ejercerse: lo digital. Y es en su exploración donde cada día los editores depuran formas de edición y establecen nuevas. Es ahí de donde surgen interrogantes y alternativas en torno a lo que es, será y tiene que ser la publicación digital: su reconocimiento, su interés, su eficacia. En fin, caminos inciertos que los editores recorren hacia la innovación y la creación.
Dirigido a editores digitales y a todos los involucrados o interesados en el proceso de edición digital: profesionistas en el área, estudiantes y público en general.

martes, febrero 15, 2005

La investigación [filológica]

Se diluye. Mi concepto acerca de la investigación filológica aparece cada vez más desleído. Incluso podría ir más allá. Me atormenta mi inseguridad sobre el significado real de la investigación.
La figura de un 'filólogo con destrezas informáticas', la idea del 'filólogo puro', la 'interacción entre informáticos y filólogos', el 'aprendizaje automático'... revolotean por mi mente sin lograr obtener un contexto válido, un sentido justo, una aplicación palpable. Una vez más, el Túnel. "(...) y que en todo caso había un solo túnel, oscuro y solitario: el mío, el túnel en que había transcurrido mi infancia, mi juventud, toda mi vida." Ernesto Sábato (El túnel). Y cabe añadir: toda mi investigación.

miércoles, febrero 02, 2005

TECNOFILOLOGÍA, una cuestión nominal.

He de reconocerlo, el título de este blog no me pertenece. Este término se lo debo, como tantas otras cosas, a mi mentora, la doctora Carmen Isasi Martínez, "titulista" oficial y alma mater, a mi parecer, de la investigación filológica deustense. "Tecnofilología" fue empleado por primera vez hace un par de años en un artículo isasiano publicado en la Revista UD, revista oficial de la Universidad de Deusto. Grito desgarrado en favor de una disciplina en proceso de cambio, una disciplina que pretende asomarse a los nuevos horizontes tecnológicos.
Se trata de mi primera recomendación bibliográfica virtual, pero prometo que no defraudará: Carmen Isasi: Tecnofilología, Revista UD, enero-marzo 2003, pág. 32.

martes, febrero 01, 2005

Una escueta bienvenida

Lo reconozco, es la primera vez que me enfrento a un Blog. No sé muy bien si seré capaz de administrarlo regularmente, de completarlo con coherencia o de convertirlo en una página interesante, pero al menos lo intentaré. Nando, uno de mis compañeros de trabajo, me ha sugerido en varias ocasiones que coloque en la red mis escasos conocimientos filológicos que a él tanto agradan. Con esa finalidad comienzo este cuaderno de bitácora, con la intención de poner al servicio de una comunidad más amplia la en ocasiones selectiva vertiente filológica, siguiendo, aunque sin pretensión de igualar, a los grandes de este mundo que tiempo ha se embarcaron ya en estas empresas (vid. www.jamillan.com). Confiemos en que este deseo llegue a buen puerto.
Vosotros, tripulantes-lectores virtuales -aunque bien reales- seréis los testigos de esta travesía. Os deseo a todos un buen viaje.