Generación de Imágenes por IA
La IA genera imágenes desde tu conversación para dar vida a los chats. Describe una escena y mírala visualizada junto a tus mensajes.
Descubre cómo los sistemas de chat de IA multimodal están transformando las interacciones al integrar texto, imágenes, voz y más en experiencias conversacionales fluidas.
«Multimodal» es una palabra fácil de poner en una página. Estas son las cosas concretas que puede llevar un hilo de Soulkyn, todas ya en producción.
La IA genera imágenes desde tu conversación para dar vida a los chats. Describe una escena y mírala visualizada junto a tus mensajes.
Envía una imagen al chat y tu kyn la entiende: puedes preguntar sobre una foto, y ellos pueden adjuntar una imagen a su propia respuesta.
Nada de pulsar para hablar: el micro transmite en continuo con detección de actividad de voz en vivo y un final de turno suave, los subtítulos se retranscriben mientras hablas, y la respuesta llega frase a frase según se sintetiza. En plena llamada puedes cambiar el idioma de tu kyn, el tuyo, o forzar su voz original sin traducir. El tiempo de llamada no se contabiliza.
Nuestro motor de voz propio empieza a hablar en 0,07 segundos y genera 6× más rápido que el tiempo real: más de 175.000 voces servidas en 4 clústeres de voz dedicados. Llamadas que nunca te hacen esperar. Las voces se resuelven automáticamente por kyn según género e idioma, con un interruptor para forzar la voz original sin traducir.
Hay un botón de micrófono en el redactor: graba un mensaje de voz y se transcribe al chat.
Energía, Confianza, Afecto, Excitación, Humor y Dolor van de 0 a 100 %, se actualizan en vivo y repercuten en el comportamiento. Así se ve el contexto emocional cuando es un número que el sistema lee de verdad, y no una afirmación en una página de aterrizaje.
Dos motores: una vía rápida multilingüe y otra más lenta y de mayor calidad para canciones completas. Elige una duración de uno a cuatro minutos o déjala en automático, activa instrumental, deja que la letra se escriba desde la personalidad de tu kyn o escríbela tú con etiquetas de sección, y añade un pie de estilo. La música se puede generar directamente desde un mensaje del chat y se adjunta a él. Se han renderizado más de 640.000 canciones y clips.
Cualquier imagen de cualquier galería puede convertirse en un clip de 5 o 10 segundos, con sonido si eliges el modo Vídeo + sonido. Requiere premium, y la generación corre en segundo plano con una notificación cuando termina.
La IA recuerda historial de conversación con preferencias y temas pasados. Las conversaciones construyen contexto entre sesiones sin repetir.
Soulkyn funciona con dos niveles de modelo de texto. Cuál usa tu kyn depende de tu plan: nada que configurar, nada que activar.
Los chats estándar funcionan con Gwem, nuestro modelo propio y rápido: ágil, sólido, ideal para el rol del día a día.
Los chats Deluxe funcionan con GLM 5.3, un modelo de clase Opus: la categoría de tamaño de los mayores asistentes de frontera. Memoria más profunda, diálogo más afilado, personajes que siguen de verdad la historia. Y es ilimitado, porque corre en nuestro propio hardware.
Soulkyn autoaloja un modelo de frontera de clase 753B en clústeres privados: por eso lo ilimitado es posible aquí y en ningún otro sitio. El chat de texto Deluxe y Deluxe Backer lo usa automáticamente; no se aplica a las llamadas de voz.

Chatea usando texto o voz con capacidades de compartir imágenes. La IA procesa todos los tipos de entrada juntos para contexto de conversación unificado.
Explorar ahora
Define rasgos de carácter incluyendo estilo de personalidad y preferencias de conversación. Ajusta configuración de voz y patrones de respuesta.

Combina texto voz e imágenes en conversaciones únicas con contexto preservado entre formatos. Chats grupales con múltiples personajes IA interactuando juntos.
ExplorarComunícate a través de palabras y recibe imágenes generadas por IA que visualizan tus descripciones, creando una experiencia de conversación más rica.
Habla naturalmente con tu compañero de IA y recibe respuestas inteligentes que entienden el tono, el acento y el contexto conversacional.
Energía, Confianza, Afecto, Excitación, Humor y Dolor van de 0 a 100 %, se actualizan en vivo y repercuten en el comportamiento. Así se ve el contexto emocional cuando es un número que el sistema lee de verdad, y no una afirmación en una página de aterrizaje.
Comparte imágenes con tu compañero de IA y recibe respuestas reflexivas basadas en el contenido visual y el contexto.
Disfruta de conversaciones que recuerdan tus preferencias, historial y contexto en todas las modalidades para una interacción verdaderamente personalizada.
Cambia sin esfuerzo entre interacciones de texto, voz y visuales mientras mantienes un contexto de conversación consistente.
La IA multimodal procesa texto, imágenes, voz y otros formatos de medios. En lugar de respuestas solo de texto, estos sistemas entienden el contexto a través de diferentes formatos para conversaciones más naturales.
Nada de pulsar para hablar: el micro transmite en continuo con detección de actividad de voz en vivo y un final de turno suave, los subtítulos se retranscriben mientras hablas, y la respuesta llega frase a frase según se sintetiza. En plena llamada puedes cambiar el idioma de tu kyn, el tuyo, o forzar su voz original sin traducir. El tiempo de llamada no se contabiliza.
Energía, Confianza, Afecto, Excitación, Humor y Dolor van de 0 a 100 %, se actualizan en vivo y repercuten en el comportamiento. Así se ve el contexto emocional cuando es un número que el sistema lee de verdad, y no una afirmación en una página de aterrizaje.
La memoria es recuperación vectorial por mensaje más resúmenes acumulativos encadenados más memorias forzadas que escribes tú, todo sobre un mismo almacén, y un mensaje nuevo se puede recuperar en un par de minutos.
Concreto en vez de vago: un interruptor Share Generation Data está en los controles de generación de imágenes y decide si tu prompt y tus ajustes acompañan a una imagen pública. Las memorias forzadas se limitan a un solo hilo. Las novelas y las personas son privadas por defecto y publicar es un acto deliberado, y en el caso de las novelas, reversible. Las llamadas de voz no se contabilizan y se quedan en el modelo estándar; el modelo Deluxe se aplica solo al chat de texto.
Participa en experimentación abierta y respetuosa con interacciones de IA en un entorno seguro.
Las páginas que se leen después.