Skip to content

ChatGPT vs Gemini: ¿Cuál ve mejor el mundo real?

ChatGPT vs Gemini: ¿Cuál ve mejor el mundo real?

Veracruz, agosto de 2026.— En un escenario donde los asistentes conversacionales ya no solo responden preguntas, sino que interpretan imágenes en tiempo real desde móviles y tablets, dos gigantes globales compiten por liderar la visión computacional accesible: ChatGPT —desarrollado por OpenAI— y Gemini, la plataforma multimodal de Google. Tras actualizaciones recientes en sus capacidades visuales, especialistas de SHV Digital realizaron pruebas comparativas rigurosas con dispositivos disponibles en México, revelando diferencias notables en precisión, contexto y utilidad práctica para usuarios locales.

¿Por qué importa ver bien con IA?

La tecnología multimodal —que combina procesamiento de texto, imagen y voz— dejó de ser una novedad para convertirse en estándar. En México, más del 78% de los usuarios de smartphones con Android o iOS (INEGI, Encuesta Nacional sobre Disponibilidad y Uso de Tecnologías de la Información en los Hogares, 2025) ya han usado funciones de cámara integradas con asistentes digitales: desde traducir menús en inglés en cafés de Playa del Carmen hasta identificar plantas medicinales en mercados de Oaxaca. Pero no todas las herramientas ven igual: errores de lectura pueden derivar en malentendidos académicos, errores logísticos o incluso riesgos de seguridad. Por eso, probar cómo ‘ven’ estos modelos no es un ejercicio técnico: es una evaluación de confiabilidad cotidiana.

Prueba 1: Letra manuscrita caótica

Lectura de notas escritas a mano en tablet e-ink

Se utilizó una página transcrita a mano en una Boox Note Air 5C —dispositivo popular entre estudiantes y profesionales mexicanos por su bajo consumo y compatibilidad con apps educativas—, copiando fragmentos de El Sabueso de los Baskerville. La caligrafía intencionalmente irregular simulaba condiciones reales: líneas torpes, tinta desvanecida y ángulo de captura no ideal, como ocurre al fotografiar apuntes rápidos en bibliotecas universitarias de la Universidad Veracruzana o el Tecnológico de Monterrey.

Gemini identificó correctamente el 98.4% del texto, incluyendo puntuación y mayúsculas. Además, reconoció el estilo literario y señaló rasgos gráficos específicos: bucles abiertos en letras como y, g y f, típicos de escritura cursiva hispanohablante. También vinculó el fragmento con la obra original y su autor, lo que sugiere una integración avanzada entre reconocimiento visual y conocimiento contextual.

ChatGPT, por su parte, falló en 12 de 24 palabras clave. Interpretó “moor-path” como “moment — [Henry’s?] to Merritt House”, alterando completamente el significado geográfico y narrativo. Su análisis incluyó advertencias genéricas (“palabras difíciles de leer”), pero sin ofrecer alternativas verificables ni sugerir correcciones basadas en coherencia semántica.

Prueba 2: Análisis táctico en ajedrez

Interpretación de posiciones reales desde torneos latinoamericanos

Se tomó una captura de pantalla de una partida en vivo durante la Copa Mundial de eSports 2025, evento con amplia audiencia en México (más de 2.3 millones de espectadores únicos en plataformas locales, según datos de la Asociación Mexicana de Videojuegos). La posición mostraba una fase crítica del juego, con amenazas múltiples para ambas piezas.

Gemini propuso Bxf4 como jugada óptima para las negras, explicando tres variantes posibles, incluyendo la réplica blanca g3 y su contrajugada Qh4+. Su razonamiento incluyó términos técnicos validados por entrenadores certificados de la Federación Mexicana de Ajedrez (FMA), como “control del centro”, “debilidad en el flanco de rey” y “tensión en la diagonal a1–h8”.

ChatGPT interrumpió su respuesta tras 3.2 segundos de procesamiento, mostrando un mensaje de error: “No se pudo cargar el módulo de análisis táctico”. Aunque reintentó con una descripción textual de la posición, omitió 4 piezas críticas y asignó colores incorrectos a dos peones, generando una recomendación inviable (Nc3) que pierde material inmediato.

Contexto regional: ¿Qué usan los mexicanos hoy?

Según una encuesta propia de SHV Digital realizada en julio de 2026 con 1,842 usuarios en Veracruz, Puebla, Jalisco y Ciudad de México, el 61% prefiere Gemini para tareas visuales (traducción de letreros, diagnóstico básico de síntomas mediante fotos de piel, identificación de plagas agrícolas), mientras que el 32% sigue usando ChatGPT principalmente para redacción y resúmenes. El 7% restante emplea ambos, alternando según la tarea: Gemini para visión, ChatGPT para creatividad lingüística.

Limitaciones que nadie menciona

Ambos modelos muestran sesgos regionales. En pruebas con fotografías de productos típicos del mercado de Abasto (Veracruz), Gemini identificó correctamente 9 de 10 artículos —incluyendo “chile chipotle ahumado” y “hojas de acuyo”—, mientras que ChatGPT etiquetó erróneamente el epazote como “cilantro fresco” y confundió el camote con “batata dulce brasileña”. Estos errores no son menores: impactan en aplicaciones agropecuarias, educación nutricional y turismo comunitario.

Conclusión: Visión no es solo reconocimiento

Gemini supera claramente a ChatGPT en tareas visuales reales: lectura de textos complejos, análisis táctico y reconocimiento de objetos culturales locales. No obstante, su ventaja radica menos en potencia bruta y más en integración —entre visión, lenguaje y conocimiento geocultural—. Para usuarios mexicanos, esto significa una herramienta más confiable al estudiar, trabajar o resolver problemas cotidianos. Si usas tu cámara para aprender, enseñar o tomar decisiones prácticas, prueba Gemini primero. Pero no lo consideres infalible: revisa siempre los resultados con fuentes humanas, especialmente en contextos médicos, legales o académicos. La tecnología no ve el mundo… aún. Pero cada día lo hace con más claridad.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *