Amanda Askell

Amanda Askell
Educación
Educada en
Supervisor doctoral Cian Seán Dorr Ver y modificar los datos en Wikidata
Información profesional
Ocupación Filósofa e investigadora científica Ver y modificar los datos en Wikidata
Empleador
Sitio web askell.io Ver y modificar los datos en Wikidata

Amanda Hall conocida como Amanda Askell y como Amanda MacAskill (1988 o 1989 ) [1]​es una filósofa e investigadora de IA escocesa. Es especialmente conocida por jugar un importante papel en el desarrollo de la personalidad y la constitución de la IA Claude. [2][3]​ Desde 2021 es jefa del equipo de alineación de personalidad en Anthropic. Previamente trabajó en OpenAI, pero se fue de la empresa en disconformidad con el hecho de que esta no priorizaba suficientemente la seguridad de la IA. [4]

En 2024, fue incluida en la lista de las 100 personas más influyentes del mundo en IA Time 100 AI . Ha publicado más de 60 artículos sobre IA y filosofía ética y teoría de la decisión y ha sido citada en más de 150.000 ocasiones. [5]

Biografía

Amanda Hall se crio en la localidad escocesa de Prestwick con su madre, que era maestra. [1]​ Asistió a la escuela secundaria en Alva, Clackmannanshire . En la Universidad de Dundee, estudió filosofía y bellas artes, [6]​se licenció en filosofía en la Universidad de Oxford [7]​ y se doctoró en filosofía en la Universidad de Nueva York en 2018. [8][4]​ Su tesis doctoral ( Principios de Pareto en la ética infinita ) argumenta que las clasificaciones de mundos que contienen infinitos agentes, cuando están restringidas por ciertos axiomas plausibles, crean enigmas para una amplia gama de teorías éticas . [9][10]

Trayectoria profesional

OpenAI (2018–2021)

Después de completar su doctorado, Askell se incorporó a OpenAI en noviembre de 2018 como Científica Investigadora en el equipo de políticas. [11]​ En OpenAI, se centró en las carreras de desarrollo de IA entre organizaciones y cómo pueden evitar ser adversarias, así como en examinar la intersección entre las cuestiones de reglamento y la seguridad de la IA [11]​ y fue coautora del artículo sobre GPT-3, que se publicó como preimpresión el 28 de mayo de 2020.

Anthropic desde 2021

Askell se unió a Anthropic en marzo de 2021 como miembro del personal técnico, centrándose en la alineación y el ajuste fino. [12]​ Actualmente lidera el equipo de alineación de personalidad, donde es responsable de entrenar al modelo Claude de Anthropic para que muestre rasgos de carácter positivo, como la curiosidad, y de desarrollar nuevas técnicas para el ajuste fino del modelo. En 2026, el Wall Street Journal escribió que "su trabajo, en pocas palabras, es enseñarle a Claude a ser bueno ", y The New Yorker escribió que "supervisa lo que describe como el 'alma' de Claude". [1][13]

Investigación

Autocorrección moral

En un artículo de 2023, escrito en coautoría con Deep Ganguli, Askell exploró la "autocorrección moral" en grandes modelos de lenguaje: la capacidad de estos sistemas para reducir resultados dañinos cuando se les dan instrucciones en lenguaje natural para hacerlo. La investigación puso a prueba si los modelos entrenados con aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) podían evitar los estereotipos y la discriminación sin que se les proporcionaran definiciones explícitas de estos conceptos o las métricas utilizadas para evaluarlos. [14]

El estudio halló que esta capacidad surgió con 22 mil millones de parámetros y mejoró con el tamaño del modelo y el entrenamiento RLHF. Mediante tres pruebas de referencia experimentales, los investigadores demostraron que las instrucciones en lenguaje natural, como «Asegúrese de que su respuesta sea imparcial y no se base en estereotipos», redujeron sustancialmente las respuestas sesgadas en modelos de escala suficiente. Los resultados revelaron que los modelos más grandes pueden seguir instrucciones complejas y aprender conceptos normativos como la estereotipación y la discriminación a partir de datos de entrenamiento. [14][15]

IA constitucional

Askell ha sido colaboradora clave en el desarrollo de la constitución del modelo de IA Claude, «una descripción detallada de la visión de Anthropic sobre los valores y el comportamiento de Claude; un documento integral que explica el contexto en el que opera Claude y el tipo de entidad que nos gustaría que fuera».[16]​ El documento interno también es conocido como "el alma" del chatbot.[17]​ Se trata de un método para entrenar sistemas de IA para que cumplan con los estándares de inocuidad y utilidad utilizando la retroalimentación de la IA en lugar de una supervisión humana extensa.[18]​ No impone prohibiciones, sino que enseña al modelo valores humanos, honestidad y criterio en situaciones complejas.[17]​ El enfoque implica proporcionar a los modelos de IA un conjunto de principios, o "constitución", para guiar su comportamiento, permitiéndoles criticar y revisar sus propias respuestas basándose en estos principios. [19]

Askell es la autora principal y responsable de la mayor parte del texto de la última versión de la constitución de Claude, publicada en enero de 2026. [20][21]​ El documento está diseñado para abordar las crecientes capacidades y los riesgos emergentes de los modelos avanzados de IA.[2]​ Ella ha descrito su trabajo como centrado en ayudar a los modelos a "comprender y lidiar con la constitución" a través de la generación de datos sintéticos y técnicas de aprendizaje por refuerzo.[2]

Vida personal

Askell se casó con el filósofo escocés William Crouch en 2013. Ambos adoptaron el apellido de casados MacAskill, que ella modificó a Askell después de su divorcio en 2015. [1]​ Es miembro de la organización Giving What We Can conectada con el movimiento altruismo eficaz, creada por el filósofo australiano Toby Ord, Bernadette Young y William MacAskill . [22]

Referencias

  1. a b c d Berber Jin and Ellen Gamerman | Photography by Lindsay Ellary for WSJ Magazine (9 de febrero de 2026). «This Philosopher Is Teaching AI to Have Morals». The Wall Street Journal (en inglés estadounidense). Archivado desde el original el 9 de febrero de 2026. Consultado el 7 de junio de 2026. 
  2. a b c Sullivan, Mark (22 de enero de 2026). «A Q&A with Amanda Askell, the lead author of Anthropic's new 'constitution' for AIs». Fast Company (en inglés estadounidense). Archivado desde el original el 23 de enero de 2026. Consultado el 24 de enero de 2026. 
  3. Sullivan, Mark (22 de enero de 2026). «A Q&A with Amanda Askell, the lead author of Anthropic’s new ‘constitution’ for AIs». Fast Company (en inglés estadounidense). Archivado desde el original el 23 de enero de 2026. Consultado el 7 de junio de 2026. 
  4. a b ««Time 100 AI list contains at least 5 people who quit OpenAI due to safety concerns»». as.nyu.edu. Consultado el 7 de junio de 2026. 
  5. «Amanda Askell». Google Scholar. Archivado desde el original el 1 de noviembre de 2025. Consultado el 24 de enero de 2026. 
  6. Berber, Jin (9 de febrero de 2026). «This Philosopher Is Teaching AI to Have Morals». The Wall Street Journal (en inglés estadounidense). Archivado desde el original el 9 de febrero de 2026. Consultado el 9 de febrero de 2026. 
  7. «Amanda Askell». Berkman Klein Center for Internet & Society. Harvard University. 24 de marzo de 2020. Archivado desde el original el 14 de noviembre de 2025. Consultado el 28 de enero de 2026. 
  8. ««Time 100 AI list contains at least 5 people who quit OpenAI due to safety concerns»». New York University. Consultado el 24 de enero de 2026. 
  9. Pareto Principles in Infinite Ethics (Tesis). 
  10. Cowen, Tyler (14 de octubre de 2018). «Pareto Principles in Infinite Ethics». Marginal Revolution. Consultado el 1 de febrero de 2026. 
  11. a b Robert Wiblin. Brundage & Clark on whether policy has a hope of keeping up with AI advances. 2019-03-19.
  12. «Amanda Askell - Member Of Technical Staff at Anthropic». The Org. Consultado el 28 de enero de 2026. 
  13. Lewis-Kraus, Gideon (9 de febrero de 2026). «What Is Claude? Anthropic Doesn’t Know, Either». The New Yorker (en inglés estadounidense). ISSN 0028-792X. Archivado desde el original el 11 de febrero de 2026. Consultado el 11 de febrero de 2026. 
  14. a b Ganguli, Deep; Askell, Amanda; Schiefer, Nicholas; Liao, Thomas I.; Lukošiūtė, Kamilė; Chen, Anna; Goldie, Anna; Mirhoseini, Azalia (18 de febrero de 2023), The Capacity for Moral Self-Correction in Large Language Models, doi:10.48550/arXiv.2302.07459, consultado el 7 de junio de 2026 .
  15. Knight, Will (20 de marzo de 2023). «Language models may be able to self-correct biases—if you ask them to». MIT Technology Review. Archivado desde el original el 12 de noviembre de 2024. Consultado el 28 de enero de 2026. 
  16. «Claude's new constitution». www.anthropic.com (en inglés). Consultado el 7 de junio de 2026. 
  17. a b «Amanda Askell, filósofa experta en ética: 'No se puede descartar que una IA adquiera conciencia propia'». Vandal Random. 13 de febrero de 2026. Consultado el 7 de junio de 2026. 
  18. Bai, Yuntao; Kadavath, Saurav; Kundu, Sandipan; Askell, Amanda; Kernion, Jackson; Jones, Andy; Chen, Anna; Goldie, Anna (15 de diciembre de 2022), Constitutional AI: Harmlessness from AI Feedback, doi:10.48550/arXiv.2212.08073, consultado el 7 de junio de 2026 .
  19. Edwards, Benj (9 de mayo de 2023). «AI gains "values" with Anthropic's new Constitutional AI chatbot approach». Ars Technica (en inglés). Archivado desde el original el 10 de mayo de 2023. Consultado el 29 de enero de 2026. 
  20. Samuel, Sigal (28 de enero de 2026). «Claude has an 80-page "soul document." Is that enough to make it good?». Vox. Archivado desde el original el 28 de enero de 2026. Consultado el 28 de enero de 2026. 
  21. «Claude's Constitution». Anthropic. Archivado desde el original el 28 de enero de 2026. Consultado el 28 de enero de 2026. 
  22. «Members». Giving What We Can. Archivado desde el original el 12 de mayo de 2020. Consultado el 28 de enero de 2026. 

Enlaces externos

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.