Artificial intelligence-driven clinical guideline recommendations in maternal care: How trustworthy are they?

Saved in:
Bibliographic Details
Title: Artificial intelligence-driven clinical guideline recommendations in maternal care: How trustworthy are they?
Alternate Title: ¿Es bueno confiar en recomendaciones de la inteligencia artificial basadas en guías clínicas?
Authors: Pérez, Jairo J.1, Giraldo-Forero, Andrés F.2, Rúa, Santiago3, Betancur, Daniel4, Urquina, Zuliany1, Castañeda, Pablo1, Arango-Valencia, Sara5,6, Guillermo Barrientos-Gómez, Juan5,6, Torres-Silva, Ever A.2, Orozco-Duque, Andrés1
Source: Biomédica: Revista del Instituto Nacional de Salud. 2025 Special Issue, Vol. 45, p37-51. 15p.
Subjects: MATERNAL health services, LANGUAGE models, TRUST, ARTIFICIAL intelligence, NATURAL language processing, TREATMENT effectiveness, MEDICAL protocols, EMPIRICAL research
Abstract (English): Introduction. Medical staff often face difficulties in consulting and applying clinical guidelines in practice. Large language models, especially when combined with retrievalaugmented generation, may help overcome these challenges by producing context-specific outputs with improved adherence to medical guidelines. Objectives. To assess the performance of commercial large language models in answering maternal health questions within retrieval-augmented generation systems, using both human and automated evaluation metrics. Material and methods. A controlled experiment was designed to obtain accurate, consistent answers from a retrieval-augmented generation system based on Colombian maternal care guidelines. A physician formulated ten questions and defined the groundtruth answers. Various large language models were tested with a standardized prompt and evaluated through binary answer-concept ranking and retrieval-augmented generation assessment, metrics, judged by two independent large language models. Results. Generative pre-trained transformer 3.5 (GPT-3.5) achieved the highest physicianassessed accuracy (0.90). Claude 3.5 obtained the top faithfulness score (0.78) under GPT-4.o evaluation, while Mistral ranked highest (0.84) under Claude 3.5 evaluation. Regarding answer relevance, GPT-3.5 scored highest across both judges (0.94 and 0.86). Conclusions. Integrating retrieval-augmented generation into obstetric care has the potential to enhance evidence-based practices and improve patient outcomes. However, rigorous validation of accuracy and context-specific reliability is essential before clinical deployment. The findings of this study indicate that large-scale models (e.g., GPT-3.5, Claude, Llama 70B) consistently outperform lighter models such as Llama 8B. [ABSTRACT FROM AUTHOR]
Abstract (Spanish): Introducción. El personal médico enfrenta limitaciones al consultar y utilizar guías clínicas en la práctica. Las recientes tecnologías de inteligencia artificial, como los modelos de lenguaje a gran escala -también llamados "pesados"-(large language models, LLM), pueden ayudar a superar estas limitaciones. Cuando se usa la generación aumentada por recuperación (retrieval-augmented generation, RAG) a estos modelos, las respuestas generadas se vuelven más relevantes en contextos específicos y se ajustan mejor a las guías médicas. Objetivo. Evaluar el desempeño de los modelos comerciales de lenguaje a gran escala mediante sus respuestas, cuando se trata de preguntas relacionadas con la atención materna en sistemas de generación aumentada por recuperación, supervisados estos sistemas mediante mediciones humanas y automáticas. Material y métodos. Se diseñó un experimento controlado para obtener respuestas precisas y constantes de un sistema de generación aumentada por recuperación, utilizando las guías colombianas para la atención materna. Un médico formuló diez preguntas y determinó las respuestas de referencia. Se generó una instrucción (prompt) para la inteligencia artificial y se evaluaron varios modelos de lenguaje a gran escala, utilizando: 1) una clasificación binaria humana de conceptos en las respuestas, y 2) los valores de la evaluación de la generación aumentada por recuperación (retrieval-augmented generation assessment, RAGAS), juzgadas por otro modelo de lenguaje. Resultados. El modelo GPT-3.5 (generative pre-trained transformer 3.5) obtuvo la puntuación más alta en la evaluación médica, con una precisión de 0,9. Mediante la valoración por GPT-4, el modelo Claude 3.5 fue el mejor calificado, destacándose una fidelidad de 0,78. Por otra parte, mediante la evaluación por Claude 3.5, el modelo Mistral obtuvo la puntuación más alta, con una fidelidad de 0,84. En cuanto a la relevancia de las respuestas, el modelo GPT-3.5 obtuvo la puntuación más alta en ambas evaluaciones: 0,94 con GPT-4o y 0,86 con Claude 3.5. Conclusiones. La integración de la generación aumentada por recuperación en obstetricia puede mejorar las prácticas basadas en la evidencia, optimizando los resultados para los pacientes. Sin embargo, es crucial evaluar la precisión de las respuestas y la información específica del contexto antes de su uso clínico. Los resultados del presente estudio sugieren que los modelos pesados o a gran escala, como GPT-3.5, Claude o Llama 70B, superan siempre a los modelos más livianos o a menor escala, como Llama 8B. [ABSTRACT FROM AUTHOR]
Copyright of Biomédica: Revista del Instituto Nacional de Salud is the property of Instituto Nacional de Salud of Colombia and its content may not be copied or emailed to multiple sites without the copyright holder's express written permission. Additionally, content may not be used with any artificial intelligence tools or machine learning technologies. However, users may print, download, or email articles for individual use. This abstract may be abridged. No warranty is given about the accuracy of the copy. Users should refer to the original published version of the material for the full abstract. (Copyright applies to all Abstracts.)
Database: MedicLatina
FullText Links:
  – Type: pdflink
Text:
  Availability: 0
Header DbId: lth
DbLabel: MedicLatina
An: 190598937
AccessLevel: 6
PubType: Academic Journal
PubTypeId: academicJournal
PreciseRelevancyScore: 0
IllustrationInfo
Items – Name: Title
  Label: Title
  Group: Ti
  Data: Artificial intelligence-driven clinical guideline recommendations in maternal care: How trustworthy are they?
– Name: TitleAlt
  Label: Alternate Title
  Group: TiAlt
  Data: ¿Es bueno confiar en recomendaciones de la inteligencia artificial basadas en guías clínicas?
– Name: Author
  Label: Authors
  Group: Au
  Data: <searchLink fieldCode="AR" term="%22Pérez%2C+Jairo+J%2E%22">Pérez, Jairo J.</searchLink><relatesTo>1</relatesTo><br /><searchLink fieldCode="AR" term="%22Giraldo-Forero%2C+Andrés+F%2E%22">Giraldo-Forero, Andrés F.</searchLink><relatesTo>2</relatesTo><br /><searchLink fieldCode="AR" term="%22Rúa%2C+Santiago%22">Rúa, Santiago</searchLink><relatesTo>3</relatesTo><br /><searchLink fieldCode="AR" term="%22Betancur%2C+Daniel%22">Betancur, Daniel</searchLink><relatesTo>4</relatesTo><br /><searchLink fieldCode="AR" term="%22Urquina%2C+Zuliany%22">Urquina, Zuliany</searchLink><relatesTo>1</relatesTo><br /><searchLink fieldCode="AR" term="%22Castañeda%2C+Pablo%22">Castañeda, Pablo</searchLink><relatesTo>1</relatesTo><br /><searchLink fieldCode="AR" term="%22Arango-Valencia%2C+Sara%22">Arango-Valencia, Sara</searchLink><relatesTo>5,6</relatesTo><br /><searchLink fieldCode="AR" term="%22Guillermo+Barrientos-Gómez%2C+Juan%22">Guillermo Barrientos-Gómez, Juan</searchLink><relatesTo>5,6</relatesTo><br /><searchLink fieldCode="AR" term="%22Torres-Silva%2C+Ever+A%2E%22">Torres-Silva, Ever A.</searchLink><relatesTo>2</relatesTo><br /><searchLink fieldCode="AR" term="%22Orozco-Duque%2C+Andrés%22">Orozco-Duque, Andrés</searchLink><relatesTo>1</relatesTo>
– Name: TitleSource
  Label: Source
  Group: Src
  Data: <searchLink fieldCode="JN" term="%22Biomédica%3A+Revista+del+Instituto+Nacional+de+Salud%22">Biomédica: Revista del Instituto Nacional de Salud</searchLink>. 2025 Special Issue, Vol. 45, p37-51. 15p.
– Name: Subject
  Label: Subjects
  Group: Su
  Data: <searchLink fieldCode="DE" term="%22MATERNAL+health+services%22">MATERNAL health services</searchLink><br /><searchLink fieldCode="DE" term="%22LANGUAGE+models%22">LANGUAGE models</searchLink><br /><searchLink fieldCode="DE" term="%22TRUST%22">TRUST</searchLink><br /><searchLink fieldCode="DE" term="%22ARTIFICIAL+intelligence%22">ARTIFICIAL intelligence</searchLink><br /><searchLink fieldCode="DE" term="%22NATURAL+language+processing%22">NATURAL language processing</searchLink><br /><searchLink fieldCode="DE" term="%22TREATMENT+effectiveness%22">TREATMENT effectiveness</searchLink><br /><searchLink fieldCode="DE" term="%22MEDICAL+protocols%22">MEDICAL protocols</searchLink><br /><searchLink fieldCode="DE" term="%22EMPIRICAL+research%22">EMPIRICAL research</searchLink>
– Name: Abstract
  Label: Abstract (English)
  Group: Ab
  Data: Introduction. Medical staff often face difficulties in consulting and applying clinical guidelines in practice. Large language models, especially when combined with retrievalaugmented generation, may help overcome these challenges by producing context-specific outputs with improved adherence to medical guidelines. Objectives. To assess the performance of commercial large language models in answering maternal health questions within retrieval-augmented generation systems, using both human and automated evaluation metrics. Material and methods. A controlled experiment was designed to obtain accurate, consistent answers from a retrieval-augmented generation system based on Colombian maternal care guidelines. A physician formulated ten questions and defined the groundtruth answers. Various large language models were tested with a standardized prompt and evaluated through binary answer-concept ranking and retrieval-augmented generation assessment, metrics, judged by two independent large language models. Results. Generative pre-trained transformer 3.5 (GPT-3.5) achieved the highest physicianassessed accuracy (0.90). Claude 3.5 obtained the top faithfulness score (0.78) under GPT-4.o evaluation, while Mistral ranked highest (0.84) under Claude 3.5 evaluation. Regarding answer relevance, GPT-3.5 scored highest across both judges (0.94 and 0.86). Conclusions. Integrating retrieval-augmented generation into obstetric care has the potential to enhance evidence-based practices and improve patient outcomes. However, rigorous validation of accuracy and context-specific reliability is essential before clinical deployment. The findings of this study indicate that large-scale models (e.g., GPT-3.5, Claude, Llama 70B) consistently outperform lighter models such as Llama 8B. [ABSTRACT FROM AUTHOR]
– Name: Abstract
  Label: Abstract (Spanish)
  Group: Ab
  Data: Introducción. El personal médico enfrenta limitaciones al consultar y utilizar guías clínicas en la práctica. Las recientes tecnologías de inteligencia artificial, como los modelos de lenguaje a gran escala -también llamados "pesados"-(large language models, LLM), pueden ayudar a superar estas limitaciones. Cuando se usa la generación aumentada por recuperación (retrieval-augmented generation, RAG) a estos modelos, las respuestas generadas se vuelven más relevantes en contextos específicos y se ajustan mejor a las guías médicas. Objetivo. Evaluar el desempeño de los modelos comerciales de lenguaje a gran escala mediante sus respuestas, cuando se trata de preguntas relacionadas con la atención materna en sistemas de generación aumentada por recuperación, supervisados estos sistemas mediante mediciones humanas y automáticas. Material y métodos. Se diseñó un experimento controlado para obtener respuestas precisas y constantes de un sistema de generación aumentada por recuperación, utilizando las guías colombianas para la atención materna. Un médico formuló diez preguntas y determinó las respuestas de referencia. Se generó una instrucción (prompt) para la inteligencia artificial y se evaluaron varios modelos de lenguaje a gran escala, utilizando: 1) una clasificación binaria humana de conceptos en las respuestas, y 2) los valores de la evaluación de la generación aumentada por recuperación (retrieval-augmented generation assessment, RAGAS), juzgadas por otro modelo de lenguaje. Resultados. El modelo GPT-3.5 (generative pre-trained transformer 3.5) obtuvo la puntuación más alta en la evaluación médica, con una precisión de 0,9. Mediante la valoración por GPT-4, el modelo Claude 3.5 fue el mejor calificado, destacándose una fidelidad de 0,78. Por otra parte, mediante la evaluación por Claude 3.5, el modelo Mistral obtuvo la puntuación más alta, con una fidelidad de 0,84. En cuanto a la relevancia de las respuestas, el modelo GPT-3.5 obtuvo la puntuación más alta en ambas evaluaciones: 0,94 con GPT-4o y 0,86 con Claude 3.5. Conclusiones. La integración de la generación aumentada por recuperación en obstetricia puede mejorar las prácticas basadas en la evidencia, optimizando los resultados para los pacientes. Sin embargo, es crucial evaluar la precisión de las respuestas y la información específica del contexto antes de su uso clínico. Los resultados del presente estudio sugieren que los modelos pesados o a gran escala, como GPT-3.5, Claude o Llama 70B, superan siempre a los modelos más livianos o a menor escala, como Llama 8B. [ABSTRACT FROM AUTHOR]
– Name: AbstractSuppliedCopyright
  Label:
  Group: Ab
  Data: <i>Copyright of Biomédica: Revista del Instituto Nacional de Salud is the property of Instituto Nacional de Salud of Colombia and its content may not be copied or emailed to multiple sites without the copyright holder's express written permission. Additionally, content may not be used with any artificial intelligence tools or machine learning technologies. However, users may print, download, or email articles for individual use. This abstract may be abridged. No warranty is given about the accuracy of the copy. Users should refer to the original published version of the material for the full abstract.</i> (Copyright applies to all Abstracts.)
PLink https://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=lth&AN=190598937
RecordInfo BibRecord:
  BibEntity:
    Identifiers:
      – Type: doi
        Value: 10.7705/biomedica.7902
    Languages:
      – Code: eng
        Text: English
    PhysicalDescription:
      Pagination:
        PageCount: 15
        StartPage: 37
    Subjects:
      – SubjectFull: MATERNAL health services
        Type: general
      – SubjectFull: LANGUAGE models
        Type: general
      – SubjectFull: TRUST
        Type: general
      – SubjectFull: ARTIFICIAL intelligence
        Type: general
      – SubjectFull: NATURAL language processing
        Type: general
      – SubjectFull: TREATMENT effectiveness
        Type: general
      – SubjectFull: MEDICAL protocols
        Type: general
      – SubjectFull: EMPIRICAL research
        Type: general
    Titles:
      – TitleFull: Artificial intelligence-driven clinical guideline recommendations in maternal care: How trustworthy are they?
        Type: main
  BibRelationships:
    HasContributorRelationships:
      – PersonEntity:
          Name:
            NameFull: Pérez, Jairo J.
      – PersonEntity:
          Name:
            NameFull: Giraldo-Forero, Andrés F.
      – PersonEntity:
          Name:
            NameFull: Rúa, Santiago
      – PersonEntity:
          Name:
            NameFull: Betancur, Daniel
      – PersonEntity:
          Name:
            NameFull: Urquina, Zuliany
      – PersonEntity:
          Name:
            NameFull: Castañeda, Pablo
      – PersonEntity:
          Name:
            NameFull: Arango-Valencia, Sara
      – PersonEntity:
          Name:
            NameFull: Guillermo Barrientos-Gómez, Juan
      – PersonEntity:
          Name:
            NameFull: Torres-Silva, Ever A.
      – PersonEntity:
          Name:
            NameFull: Orozco-Duque, Andrés
    IsPartOfRelationships:
      – BibEntity:
          Dates:
            – D: 03
              M: 12
              Text: 2025 Special Issue
              Type: published
              Y: 2025
          Identifiers:
            – Type: issn-print
              Value: 01204157
          Numbering:
            – Type: volume
              Value: 45
          Titles:
            – TitleFull: Biomédica: Revista del Instituto Nacional de Salud
              Type: main
ResultId 1