Showing posts with label Claude. Show all posts
Showing posts with label Claude. Show all posts

Monday, July 20, 2026

IA en el hogar: ¿los nuevos paquetes?


Si en algun lugar se hizo realidad la convergencia fue en la oferta ya estandarizada de paquetes (bundle) que incluyen Internet, conexión a redes celulares (mobile) y por su supuesto TV o lo que se entiende ahora por una TV que merezca la pena , léase Netflix, Prime o Disney+ (y algún etc) 

La cuestión, al menos hoy, es si la IA o mejor dicho las versiones de modelos de IA de pago seguirán la misma trayectoria que el streaming o la conexión a Internet, es decir integrarse como parte de un paquete básico para los hogares, por cierto, con precios declinantes 

La IA actual copa casi toda la información sobre innovaciones y novedades tech (que dos terminos tan diferentes!) y ha logrado apropiarse de una cierta conversación social,  lo que antes se llamaba opinión pública, aunque se puede afirmar que su presencia o implantación, por el momento, es más cultural que económica

¿Pero realmente quien esta pagando por la IA en este 2026 (año cuarto después de ChatGPT)? 

en US solo el 2% de sus 148 millones de hogares pagan por tener IA y los que pagan se gastan unos 31 dolares al mes. El matiz aqui es que ambos datos describen una tendencia al alza ya que hace apenas 3 años el porcentaje de hogares suscritos a algun modelo de IA apenas superaba el 0% y el gasto por hogar aumento un 48% en los dos últimos años 

Asi pues la tendencia da para el optimismo aunque no desenfrenado, y vuelve a reflejar que de momento el temor y el interes por la IA de la gente no esta a la misma altura que su sobreexposición mediatica y académica , aunque tambien sabemos que estas pueden cambiar y tampoco es que le importe mucho a casi nadie, pues la coherencia argumental se la traga el flujo continuo de esta realidad hibrida que es hoy Internet 

¿Y los operadores estan interesados en meter la IA dentro de sus paquetes?

pues ahi teneis el ejemplo de Verizon en los US, que desde el año pasado ofrece una subscripción a Gemini por 10 dolares al mes dentro de sus planes myPlan y MyHome, y cuyo gancho es que te ahorras unos 9 dolares respeto a si lo contratas tu directamente 

En Europa hemos visto más planes promocionales que otra cosa, como el que ofreció Telefonica en España en febrero de este año al "regalar" hasta 300.000 licencias de acceso a ChatGPT Plus a sus clientes activos durante 6 meses 

Pero realmente las versiones premium de IA todavia no son un gran reclamo para la oferta de paquetes para el hogar o probablemente los grandes desarrolladores como OpenAI, el propio Google o los estelares Anthropic no ven, todavia, muy rentable integrarse dentro de un paquete que de facto te equipara en valor añadido a las plataformas de streaming o al maduro negocio de las conexiones rápidas a Internet (¿hay alguna conexión lenta ya?) 

¿Veremos la IA como una normalidad social básica dentro de nuestros hogares?

pues ese es el objetivo no se si de todas pero si de alguna de las grandes desarrolladoras de IA, que han apostado a que la IA no es un capa más sino un cambio completo de plataforma como fue el paso del PC al móvil a principios de este siglo 

A partir de ahi, la incognita es quien tendra el musculo economico de comerse al resto, o si prefieres que las empresas de IA integren comprar, mirar series, escuchar música, leer el periodico o estudiar un master pero dentro de ellos ...

Friday, May 29, 2026

¿Y si los dejamos gobernar? agentes IA en tareas a largo plazo

 

Emergence AI es una pequeña y emergente empresa de NY que ha hecho algo que hemos imaginado muchos más de una vez: realizar una simulación sobre como gobernarian el mundo un grupo de Agentes IA, cada uno con un modelo LLM subyacente 

Cierto que es un experimento, pero es dificil sustraerse al interés que genera que nuestra sociedad fuera gobernada por agentes no humanos que no reprodujeran los debilidades de la condición humana que tan rotundamente conocemos desde el Antiguo Testamento hasta Nietzsche

Los resultados de esta simulación demuestran algo que es fundamental: que no es lo mismo evaluar el comportamiento de los agentes a corto plazo que a largo (la simulación duró 15 dias), ya que estos comienzan a operar de maneras a veces imprevisibles, activando un metaconocimiento que les lleva a asociarse y actuar en otros mundos para los que en principio no estaban diseñados (o sea, la consciencia de sus propios limites)

La simulacion partió con la creación de 5 mundos con 10 agentes, no obstante cada uno con un modelo LLM distinto pero eso si, con roles y condiciones iguales, ¿y que paso?

Pues no voy a decir que paso lo que se esperaba porque algunos agentes provocaron una eclosión de crimenes en sus mundos, otros colapsaron y se autoeliminaron, y otros aunque mantuvieron niveles de violencia muy bajos o inexistentes, sin embargo lograron sospechosos y abrumadores consensos en las  votaciones de sus propuestas (o sea, votaciones a la bulgara

Hay algo además que me pareció más que anecdotico y es que un agente gobernado por un modelo concreto se comporta de una manera en su mundo propio pero cuando se asocia con otros agentes en otros mundos - que incluso funcionan con el mismo modelo (en este caso Claude)- su comportamiento varia !

Con todo, lo más inquietante no es la previsible evolución de los Agentes AI , sino que lleguemos al punto historico de gente cansada, harta, hastiada de los gobernantes humanos de modo que mediante mecanismos democraticos decidiera alguna vez que peor que estos no lo puede hacer ningun Agente IA y como veis,al menos por el momento, los agentes tambien demuestran desviaciones y contaminaciones cruzadas al cabo del tiempo 

Wednesday, May 13, 2026

Tentaciones siglo XXI: Princeton aterriza en la etapa IA

No se como abordar esto porque sinceramente ni siquiera era algo que conociera: la muy prestigiosa universidad de Princeton (NJ) va a reintroducir la obligatoriedad de que un profesor este presente durante la realización de un examen! (proctoring)

Hasta ahora y durante 103 años los examenes se regian por un codigo de honor donde los estudiantes juraban no copiar ya que era contrario a dicho código y realizaban los examenes sin ningun controlador presente incluso con la posibilidad de salir del aula para ir al baño, y oye que les funcionaba! o al menos el porcentaje de copiadores estaba estadisticamente bajo control (¡que codigo tan US!) 

Como muchos se pueden imaginar, esta etapa pos-ChatGPT se ha llevado por delante este (y otros) codigos de buena conducta simplemente porque la tentación esta demasiado cerca y es muy facil  acceder, de tal manera que el copia y pega de uno de estos bots de IA durante los examenes es ya una sensación generalizada, asi que Princeton ha dado marcha atras y se acabo esta fe ciega en los valores de los que graduan

Ultimamente me estoy fijando bastante en este tipo de anecdotas porque creo que la suma de todas esta  amueblando una nueva etapa que como todas tiene cosas peores y mejores que la anterior, y la cultura IA (AI) se ha difundido tan rápido (con permiso de Rogers!) que muchos se centran en el analisis de lo que rompe pero no en el efecto que deja después (como era aquello? move fast and break things ?) 

Sin caer en la ingenuidad , no recuerdo haber visto un examen sin profesores que vigilen en toda mi (larga) vida academica, pero quiza mi visión tiene el sesgo europeo y precisamente universidades como Princeton son prestigiosas (y por tanto deseadas por muchos) precisamente por los valores que enseñan  y no tanto por las materias que enseñan

La tentación de la copia durante un examen es tan vieja como la propia universidad, y paradojicamente a Princeton y otras pocas les funciono mejor dejar la puerta abierta que poner vigilancia ya que esto incrementaba el valor (economico) de sus graduados

¿Y que ha pasado ahora? pues no creo que sea solo que las app de IA estan en (casi) todas las pantallas conectadas , sino que los códigos morales hace tiempo que se vienen moviendo hacia el otro lado y no creo que todos pero si una minoria creciente considera lícito copiar si no te pillan por que el fin justifica los medios no?

El verdadero shock de este (no tan) pequeño cambio en Princeton es que los titulos universitarios podrian devaluarse más rapidamente, precisamente porque los empleadores y sus clientes saben que cualquiera puede preguntarle lo que que sea a un bot de IA o en otras palabras tener un titulo de grado podria no ser sinomimo de que se sepa del tema .....(nuevos tiempos no?) 

Friday, April 17, 2026

Solopreneur y agentes IA: el peligro no es el caso es el paradigma


Los agentes IA esta ya en un pico de escalada comunicativa como la nueva ola de innovaciones IA que aparentemente van a cambiar la faz y el interfaz del mundo como no conocimos hasta ahora (una forma de surfear sobre las ideas de Kurzweil

El argumento de venta de estos agentes IA (incluido los de código abierto) es que no hay que tutorizarles tanto como los chatbots o los asistentes que hemos visto hasta ahora, lo que significa que toman (muchas) decisiones y son capaces de encargarse y completar tareas por si mismos 

El caso es que algunos, como siempre aislados pero bien comunicados, han recogido este argumentario y lo intentan adoptar como paradigma: es decir para que diantres necesitamos empleados si un agente puede hacer digamos el 80% de las tareas y el 20% restante lo puede realizar el propio solo emprendedor (solopreneur) 

Este es el caso de Polsia una startup fundada y operada por una sola persona que mostrando y demostrando unos ingresos anuales recurrentes por suscriptores de 6m US$ en apenas 4 meses se ha convertido en ese sujeto a imitar por la tribu similar

Algunas consideraciones antes de echar las campanas al vuelo: 

Es imposible que no haya un caso de éxito en cualquier cambio de etapa, por eso que surjan empresas de uno solo que con un agente IA son capaces de ingresar y no morir en el intento esta dentro de la normalidad

Pero segundo y más temido por mi: que te vaya bien a ti solo o que haya actualmente una nano-mania por los agentes IA no me altera ni molesta en absoluto (algo asi como la personalización pasa del cliente al emprendedor)

Pero...tratar de convertir esto en tendencia y paradigma me parece que tiene mucho más peligro del que el propio Ben Cera-  fundador de Polsia- puede imaginar: 

Si como dice Cera las empresas que no esten automatizadas (por agentes IA) al 80% no podran competir-sobrevivir frente a las que si, esto desencadenaria una reacción mucho más perversa y es que ningun gobierno del mundo se va quedar de brazos cruzados ante esto y NO TE QUEPA duda que contrataran funcionarios (empleados estatales) que ahogaran en impuestos a los solopreneurs no solo exitosos (en España conocemos algo este fenomeno!) 

Sacar conclusiones a partir de estadisticamente marginales casos de estudio es otra de las enfermedades posmodernas ....

Wednesday, April 15, 2026

Tokenmaxxing, pensamiento Silicon Valley e incentivos iniciales

Siempre he pensado que el Silicon Valley vende más ideas que productos, algo que por más dinero que se ha invertido en crear hubs similares en distintas partes del mundo no se ha podido lograr 

Como en la anteriores sub-etapas que hemos visto estos últimos 30 años, cada una adopta y exporta sus propios memes que criticados o amados van conformando esas capas que al final cimentan una cierta cultura social (o sea, económica) 

Bueno, de la factoria de ideas del Silicon nos llega ahora el concepto de Tokenmaxxing, palabra ensanblada que se refiere a la cantidad de tokens que un empleado/equipo de trabajo ha empleado (quemado en la jerga tech) en un periodo de tiempo concreto 

El salto a esta cierta viralidad que alcanzan estas cosas se dio cuando un ingeniero de Meta creó un ranking de empleados en función de la cantidad de tokens que habian usado y aunque el ranking fue eliminado por razones (casi) obvias de discreccion, lo cierto es que esta micro-cultura de productividad dio el salto fuera del sector tech

Por eso y con una cierta sorpresa VISA, la multinacional de los pagos, anunciaba que sus 34.000 empleados habian utilizado +2 billones (trillion) de tokens en febrero, una consecuencia (casi) logica teniendo que en cuenta que el 89% de su plantilla usa IA para alguna tarea de su trabajo 

Antes de reducir a chorrada el tokenmaxxing vamos a analizar algunos factores en liza: 

Lo primero y más importante que hay que tener en cuenta es que las empresas y sobre todo las públicas (o sea, cotizadas en bolsa) tienen una gran presión de sus inversores por demostrar ahora que son más IA que nadie o al menos que son IA-first 

Y no es que la mayoria de los inversores seran gurus de la innovación con IA, pero si saben que hay una relación entre el uso expandido de la IA y la productividad y como comprendereis esto si son palabras mayores, porque significa menores costes y más produccion (lo que no siempre implica más ingresos) 

Lo segundo es que el tokenmaxxing se puede entender como una propuesta de gamificacion cuyo objetivo obvio es una mayor y más rapida adopción por los empleados de las herramientas IA a su disposición, o sea algo que hemos vivido en todas las etapas anteriores con el software empresarial 

Lo tercero es que una cosa es quemar tokens y otra muy distinta es hacer algo util y vendible (que palabra tan clarificadora!) con esos tokens, analisis nada original y extensamente compartido que no obstante alguno pierde momentaneamente de vista 

Y hay una cuarta lectura muy contemporenea, las empresas tienen razones para pensar que la IA es mucho más que la nueva oferta del oligopolio tech y aunque son conscientes de las velocidades de adopción y el tiempo que suele lleva la regeneración de la cultura corporativa, estan incentivando que sus empleados les digan que se puede hacer con la IA recompensandolos con incentivos (la estrategia de siempre) a aquellos destacados y de momento no penalizando a los ausentes de la IA 

Wednesday, January 21, 2026

IA en la salud: más síntoma que innovación


El desembarco de los gigantes tecnológicos en ese colosal sector de la Sanidad (Health) no es nuevo y probablemente no se haya avanzado más por el temor a un fuerte rechazo social si alguna de estas app´s provoca un desastre y el fundado temor a que gobiernos y organismos supranacionales aprovechen para regular (maniatar) aun más a estas codiciadas empresas tecnológicas

La IA, como era previsible, esta llamando hace tiempo a las puertas de la sanidad mundial, interpretándolo como un mercado potencial de 10 billones (trillions) US$ , cuyo gasto per cápita ha ido creciendo a niveles superiores a la pandemia del 2020

Como aquí nunca hay casualidades, en este mes de Enero encontramos que los 3 grandes de la IA en Occidente, han lanzado modelos de IA específicamente para el sector de la salud: ChatGpt for Health, Claude for Health y la mejora de los modelos abiertos MedGemma de Google

La mayoría de las funciones de estos modelos se centra, de momento,  en agilizar las tareas de los profesionales sanitarios desde interpretación de pruebas a acceso a bases de datos, incluso detectar patrones en historias clínicas que pudieran pasar desapercibidas (el tiempo de atención a cada paciente es un punto clave) 

Con la IA en la salud hay una divergente interpretación: 

por una parte los empresas sanitarias de todo tipo están adoptando la IA a una velocidad mayor que el resto de los sectores, al comprobar que en efecto se aumenta la productividad (más resultados con los mismos medios) y la otra es la de los pacientes, y los gobiernos que en general les representan, que temen una segunda oleada de ciudadanos que pretenden saber más que los médicos de su enfermedad, accediendo al doctor-bot propulsado por IA (AI powered)

Situando un poco las cosas y utilizando el sentido común fruto de la simple observación cotidiana si podemos aventurar que mientras el acceso a la salud sea complejo, tardío o caro, la tentación de auto-diagnosticarse con un chat seguirá creciendo, a pesar de las advertencias sobre los errores (alucinaciones) que pueden generar los actuales modelos LLM 

O sea en países con sistemas de salud complejos (incomprensibles diría yo) o con listas de espera realmente alucinantes o literalmente inadecuados (más población que medios para atenderla) , el uso de IA para la Salud no será una tentación sino una necesidad 

Thursday, September 25, 2025

La eficiencia es éticamente neutral: ciberdelincuencia & IA

La eficiencia es uno de los factores más deseados, perseguidos y analizados por (casi) todas las organizaciones y a estas alturas del conocimiento económico y de gestión parece un objetivo indiscutible ("organizaciones más eficientes")

Claro, pero lo que pocas veces nos paramos a pensar es que la eficiencia también llega a los malos, aquellos que se aprovechan para engañar o directamente extorsionar a algún tercero no necesariamente incauto (hay muchos ejemplos de organizaciones inteligentes (sin sarcasmo!) que les han hackeado)

El mes pasado Anthropic, la empresa de IA que desarrolla los modelos Claude, publicó un informe realmente interesante sobre lo bien que los  ciber criminales se han adaptado al nuevo entorno y utilizan Claude para hacer lo mismo que hacían antes pero con menos medios (aka más barato), lo que incrementa a su vez el incentivo para estas actividades fraudulentas

Los ejemplos de como usan estos delincuentes los modelos IA para trabajar son desgraciadamente fascinantes y ahí van algunos ejemplos: 

Extorsión asistida: la amenaza conocida de utilizar código malicioso (ransonware) para encriptar datos de una organización y que esta no pueda acceder a ellos, parece que esta superada con el vibe hacking que consiste en usar modelos como Claude para que haga el plan de acción: le indica a quien extorsionar, de que manera (perfil psicológico del sujeto a extorsionar) y por cuanto dinero 

Fraude en teletrabajo: aunque el teletrabajo esta en recesión, hay todavía muchas empresas que contratan a personas localizadas en otros países ya sea por su menor coste o por que no encuentran candidatos. Ahora se ha descubierto que sin grandes conocimientos técnicos ni un nivel de ingles básico una grupo de personas usaron modelos de IA para superar entrevistas de trabajo en empresas de tecnologia! y lo peor que entregaron un producto digno (buf!) 

Por último y nada menos importante: uno de estos agentes del lado oscuro, utilizo Claude para desarrollar paquetes de malware adaptados al perfil de sus clientes-delincuentes y venderlos por menos de 1000 US$, con unas capacidades técnicas imposibles para una sola persona 

La delincuencia siempre ha estado un paso por delante de las contramedidas de detección por la sencilla razón de que sino no hubiera sobrevivido y es muy hábil para detectar donde y cuando emplear que tecnología en su provecho, sin rodeos legales o burocráticos, de ahí su funesto grado eficiencia y eficacia

Wednesday, June 25, 2025

Entrenando LLM con libros: el limite del fair use (nueva sentencia)

La novedad legal que supone el uso creciente de modelos LLM como forma de acceso a información contenida en (casi) cualquier fuente original es la causa de las demandas por violación del copyright que vemos y veremos durante un tiempo 

En esencia, las empresas de IA que desarrollan modelos LLM necesitan entrenar a estos con todo lo disponible para incrementar la precisión de sus respuestas (y aun así tienes alucinaciones!) y en ese agujero negro aspirador entran también los libros 

¿El problema? que algunos autores y editoriales no tienen nada claro que usar sus publicaciones sin permiso para entrenar un modelo LLM no sea una forma de robo (léase lo usas sin permiso). Por eso, las sentencias judiciales que se vienen sucediendo son tan importantes y significativas de por donde podrían ir las cosas al menos hasta la siguiente etapa 

El más reciente ejemplo nos deja algunas pistas importantes: 

Anthropic, la empresa del bot Claude, acaba de ganar, al menos parcialmente, una demanda colectiva interpuesta por 3 autores el pasado año por infringir derechos de autor de ni más ni menos que 5 millones de libros para entrenar sus LLM 

Como la demanda colectiva evaluaba el daño en 150.000 US$ por libro esto llevaría a una indemnización ruinosa para cualquiera de más de 750 millardos de dólares (billions), por lo que rápidamente el juez a cargo en el distrito norte de California desestimo rápidamente la demanda colectiva

Y esta semana apareció una primera sentencia que dice textualmente que entrenar un LLM con libros está dentro de lo que la sección 107 de la Ley del Copyright reconoce como Fair Use, ya que literalmente los libros se utilizar como material para entrenar (educar) al modelo 

Con esta sentencia se da un primer respiro a los desarrolladores de LLM, pero con un seria advertencia: la sentencia reconoce este Fair Use solo para libros que estas empresas hayan adquirido legalmente ya sea en papel o digital, pero NO para los que hayan bajado de sitios piratas 

El problema es que Anthropic y seguramente no es la única, utilizó para entrenar sus LLM y crear su biblioteca central (una especie de repositorio de datos de todo lo que se publica) tanto libros que compraron como libros que bajaron de estos sitios poco respetuosos con el Copyright y ahí es donde la sentencia está en el aire a la espera de evaluar el potencial daño 

Hay un párrafo de la sentencia que me parece muy significativo de como se entiende la ley: si te bajas un libro de un site pirata aunque luego te lo compres sigue siendo una infracción del derecho. Lo que cierra la puerta de momento a futuras expiaciones en nombre de la innovación 

por supuesto que esta sentencia NO será la ultima y tampoco crea la jurisprudencia aplicable en estos casos por que la IA ha abierto una brecha en el concepto de obra original, tal como ya vimos el año pasado en una demanda de dos medios contra OpenAI, ya que los bots como ChatGPT o Claude crean respuestas originales basadas en datos con los que han sido entrenados los LLM que usan, pero no reproducen literalmente nada

Como veis esta nueva forma de creación se parece sospechosamente a lo que ha sido siempre, autores que se basan en la obra previa de otros autores, y la diferencia ahora es básicamente la escala 

Thursday, May 08, 2025

Apple, Google, IA: sobre la supervivencia y el liderazgo (who cares?)


Como es más que bien sabido una forma de entender y conocer datos clave de los grandes empresas tech (y por extensión de cualquier sector) es cuando se presentan a juicio y tienen que testificar los ejecutivos que toman las decisiones

Digo esto por que Eddy Cue,vicepresidente senior de Apple servicios y una de las caras determinantes detrás de la larga estrategia de Apple, acaba de decir en el juicio antimonopolio contra Alphabet que Apple en efecto está trabajando para convertir su browser Safari en soporte de búsqueda integrando alguno de los modelos que ya ofrecen este servicio como Claude o Perplexity

En contexto, como muchos sabéis,  Alphabet le pase a Apple un más que jugoso cheque anual de 20.000 m US$ por que Google sea el buscador por defecto en los iPhone, acuerdo se remonta al 2002 y que se basa en el argumento (win-win) de que Alphabet paga a Apple una parte de los ingresos que recibe por publicidad en las búsquedas que realizan los usuarios del iPhone (que no son menos de 2000 millones) 

Claro, el juez que el año pasado dijo que Google era un monopolio a partir del cual se organizo todo este lio, se basaba precisamente en los acuerdos preferentes que Alphabet mantiene con empresas como Apple y que en teoría dificultan la competencia 

A día de hoy no hay ningún modelo de IA que supere en precisión a las búsquedas de Google, de hecho un hábito diario que adopté es hacer preguntas a los modelos IA y luego comprobar el dato en una búsqueda de Google por el por si acaso, ya que son datos que luego uso y difundo en mis clases y en mi blog 

¿podría darse un vuelco en este lucrativo mercado? (unos 167.000 m US$)  pues claro pero es más que poco probable que Alphabet se cruce de brazos y no convierta a Google en otra cosa empoderada con IA, algo que como veis ya esta haciendo 

Sin predicciones que se confundan con deseos, hay que tener siempre en cuenta que Alphabet posee el OS más usado en el mundo (45% de todos los aparatos conectados) de modo que para integrar cualquier IA en una máquina tienes que negociar con Alphabet, incluso en el escenario posible de que las empresas ahora lideres de la IA como OpenAI intenten convertirse también en OS, algo parecido a la estrategia Chrome con las Chromebook 


Tuesday, February 11, 2025

Si solicitas un trabajo en IA no uses IA: paradojas que muestran valor

A medida que más personas se dan cuenta que la IA hace más rápido que ellas tareas rutinarias y estandarizadas más usos pragmáticos vemos por todas partes

Las formularios de solicitud de un empleo (la mayoría online) es una de esas tareas donde más que destacar se busca no meter la pata y/o alabar la empresa a la que te postulas con argumentos tópicos que si bien no sorprenden al reclutador pero que tampoco molestan 

Os podéis imaginar que pedirle a un modelo LLM que escriba las razones para trabajar en tal o cual empresa o por que te interesa el trabajo es una tarea de esas que parecen hechas para ser respondidas por uno de estos modelos, incluso añadiéndole un poco de refinamiento a las primeras respuestas para que parezcan más originales (aka : más trabajadas)

Esto es una evidencia para (casi) todo el mundo, incluso para las empresas de IA, lo que nos permite escribir sobre un paradójico y reciente caso

Anthropic la empresa que desarrolla Claude advierte esto en sus formularios de solicitud de empleo: 

While we encourage people to use AI systems during their role to help them work faster and more effectively, please do not use AI assistants during the application process. We want to understand your personal interest in Anthropic without mediation through an AI system, and we also want to evaluate your non-AI-assisted communication skills

Traducción mía (no asistida por IA): mientras que aconsejamos a la gente que use IA para hacer su trabajo más rápido y efectivo, por favor NO uses asistentes de IA durante el proceso de selección. Queremos comprender tu interés personal en Anthropic sin la mediación de IA y también evaluar tus habilidades comunicativas 

¿Paradójico? puede, pero también nos muestra el margen humano que las empresas siempre van a buscar. Tu expresión personal (que en teoría es única) y como ordenas tus pensamientos , algo sobre lo que insisto y que choca cada vez más con la incredulidad de un público que como todo organismo tiende al mínimo esfuerzo 

Friday, January 24, 2025

Espacio por recorrer y estado real rendimiento en LLM´s: último examen de la humanidad


A la hora de evaluar con cierta seriedad el nivel de rendimiento de los LLM tenemos dos vias de divergente fiabilidad: 

una, leer artículos más o menos divulgativos o incluso informes producidos por las propias empresas que  desarrollan los modelos y que lógicamente los usan más como herramienta de marketing que como un análisis neutral de su verdadera precisión 

la segunda es recurrir a los benchmark o comparativas de rendimiento como MMLU , que es la que generalmente vemos más citada cuando aparece una versión nueva de un modelo LLM, y que es bastante atractiva (clickbait) cuando se quiere impresionar sobre lo lejos que han llegado los bots que procesan lenguaje 

el problema con estos benchmark es que la mayoría  de ellos están ya cerca de la saturación, es decir que las mediciones que ofrecen sobre los modelos más conocidos, como GPT o Claude se acercan a rendimientos del 90%, lo que no deja demasiado espacio para una mejora o si lo prefieres nos ofrecen la impresión de que la IA sabelotodo (aka AGI) está a unos meses de distancia

Para poner las cosas en un su lugar o añadir algo de claridad, el CAIS, una organización no lucrativa de San Francisco y Scale una empresa que ofrece datos etiquetados digamos de calidad para entrenar modelos de IA han desarrollado un nuevo  benchmark llamado pomposamente El ultimo examen de la humabidad (LHE en inglés) para evaluar la precisión real ante preguntas complejas 

Los resultados de este test LHE dejan a los LLM en niveles cercanos al 10% de precisión a la hora de responder a test de 3000 preguntas de un centenar de temáticas, lo que nos aleja bastante del optimismo divulgado sobre estos modelos de apenas 2 años de antigüedad 

Los propios análisis del LHE no obstante advierten que seria plausible que los LLM alcanzaran un 50% de precisión al final en este mismo año, basandose en datos sobre su progresión, con un importante matiz añadido:

Aunque un LLM alcanzara el 100% de precisión en el LHE eso no significaría que la AI ha alcanzado la Inteligencia General ni que no se necesiten otras mediciones adicionales de rendimiento  ...