GPT-5.6 Sol comete 68% menos errores: ¿ya puedes confiar en ChatGPT para finanzas y salud?
OpenAI actualizó GPT-5.6 Sol, el modelo que mueve todos los chats de los usuarios de pago en ChatGPT, y presume una mejora que apunta al talón de Aquiles de la IA: la fiabilidad. Según la compañía, el nuevo GPT-5.6 Sol produce 68% menos respuestas con errores factuales que GPT-5.5 Instant en preguntas de finanzas, medicina y derecho. Suena a titular soñado. La letra pequeña merece atención.
Qué probó OpenAI (y qué no)
La cifra sale de una evaluación de alta exigencia factual hecha por la propia OpenAI: tomó prompts de finanzas, medicina y derecho —temas donde un dato mal puede costar caro— y midió con qué frecuencia la respuesta contenía al menos un error. El nuevo Sol también viene afinado para dar respuestas más cortas y directas. El problema: es una prueba interna, no un benchmark independiente. OpenAI no publicó el set de preguntas, el tamaño de la muestra ni cómo calificó, y ningún tercero ha reproducido el número.
Qué significa para América Latina
En la región, mucha gente ya usa ChatGPT como asesor informal para trámites, dudas de salud o consultas legales, muchas veces por falta de acceso a un profesional. Un GPT-5.6 Sol con menos errores es una buena noticia, pero la lección de fondo no cambia: una cifra de marketing sin auditoría externa no reemplaza a un médico, un abogado o un contador. Úsalo para orientarte y redactar, no para decidir a ciegas —y ojo con el sesgo hacia el inglés en temas locales.
El panorama
La industria pasó de competir por quién es más creativo a competir por quién miente menos. Que OpenAI ponga la fiabilidad en el centro es sano; que la midan ellos mismos, menos. La próxima frontera será que estas cifras las verifique alguien de afuera.
Lee también:
- Claude Opus 5 vs GPT-5.6 Sol: quién gana y cuál te conviene en 2026
- OpenAI abarata GPT-5.6 Luna un 80% y ChatGPT roza los 1.000 millones de usuarios semanales
Fuentes: OpenAI — Improving GPT-5.6 Sol y DataNorth.
