{"id":894345,"date":"2026-06-26T14:57:28","date_gmt":"2026-06-26T14:57:28","guid":{"rendered":"https:\/\/www.europesays.com\/us\/894345\/"},"modified":"2026-06-26T14:57:28","modified_gmt":"2026-06-26T14:57:28","slug":"evaluating-the-robustness-and-readiness-of-large-frontier-models-in-health-ai-applications","status":"publish","type":"post","link":"https:\/\/www.europesays.com\/us\/894345\/","title":{"rendered":"Evaluating the robustness and readiness of large frontier models in health AI applications"},"content":{"rendered":"<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"1.\">\n<p class=\"c-article-references__text\" id=\"ref-CR1\">Singhal, K. et al. Large language models encode clinical knowledge. Nature <b>620<\/b>, 172\u2013180 (2023).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41586-023-06291-2\" data-track-item_id=\"10.1038\/s41586-023-06291-2\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41586-023-06291-2\" aria-label=\"Article reference 1\" data-doi=\"10.1038\/s41586-023-06291-2\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"cas reference\" data-track-action=\"cas reference\" href=\"https:\/\/www.nature.com\/articles\/cas-redirect\/1:CAS:528:DC%2BB3sXhsVKju7zP\" aria-label=\"CAS reference 1\" target=\"_blank\">CAS<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=37438534\" aria-label=\"PubMed reference 1\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed central reference\" data-track-action=\"pubmed central reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC10396962\" aria-label=\"PubMed Central reference 1\" target=\"_blank\">PubMed Central<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 1\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=Large%20language%20models%20encode%20clinical%20knowledge&amp;journal=Nature&amp;doi=10.1038%2Fs41586-023-06291-2&amp;volume=620&amp;pages=172-180&amp;publication_year=2023&amp;author=Singhal%2CK\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"2.\">\n<p class=\"c-article-references__text\" id=\"ref-CR2\">Gu, Y. et al. Domain-specific language model pretraining for biomedical natural language processing. In ACM Transactions on Computing for Healthcare (HEALTH) (eds Lee, I. &amp; Stankovic, J. A.) <b>3<\/b>, 1\u221223 (Association for Computing Machinery, 2022).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"3.\">\n<p class=\"c-article-references__text\" id=\"ref-CR3\">Nori, H. et al. Sequential diagnosis with language models. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2506.22405\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2506.22405\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2506.22405<\/a> (2025).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"4.\">\n<p class=\"c-article-references__text\" id=\"ref-CR4\">OpenAI. Introducing GPT-5. <a href=\"http:\/\/openai.com\/index\/introducing-gpt-5\/\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"http:\/\/openai.com\/index\/introducing-gpt-5\/\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/openai.com\/index\/introducing-gpt-5\/<\/a> (2025).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"5.\">\n<p class=\"c-article-references__text\" id=\"ref-CR5\">Saab, K. et al. Capabilities of Gemini models in medicine. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2404.18416\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2404.18416\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2404.18416<\/a> (2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"6.\">\n<p class=\"c-article-references__text\" id=\"ref-CR6\">Tu, T. et al. Towards conversational diagnostic AI. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2401.05654\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2401.05654\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2401.05654<\/a> (2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"7.\">\n<p class=\"c-article-references__text\" id=\"ref-CR7\">Wang, S. et al. LINS: a general medical Q&amp;A framework for enhancing the quality and credibility of LLM-generated responses. Nat. Commun. <b>16<\/b>, 9076 (2025).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41467-025-64142-2\" data-track-item_id=\"10.1038\/s41467-025-64142-2\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41467-025-64142-2\" aria-label=\"Article reference 7\" data-doi=\"10.1038\/s41467-025-64142-2\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"cas reference\" data-track-action=\"cas reference\" href=\"https:\/\/www.nature.com\/articles\/cas-redirect\/1:CAS:528:DC%2BB2MXisFKisbrK\" aria-label=\"CAS reference 7\" target=\"_blank\">CAS<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=41083453\" aria-label=\"PubMed reference 7\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed central reference\" data-track-action=\"pubmed central reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC12518799\" aria-label=\"PubMed Central reference 7\" target=\"_blank\">PubMed Central<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 7\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=LINS%3A%20a%20general%20medical%20Q%26A%20framework%20for%20enhancing%20the%20quality%20and%20credibility%20of%20LLM-generated%20responses&amp;journal=Nat.%20Commun.&amp;doi=10.1038%2Fs41467-025-64142-2&amp;volume=16&amp;publication_year=2025&amp;author=Wang%2CS\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"8.\">\n<p class=\"c-article-references__text\" id=\"ref-CR8\">Arora, R. K. et al. HealthBench: evaluating large language models towards improved human health. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2505.08775\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2505.08775\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2505.08775<\/a> (2025).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"9.\">\n<p class=\"c-article-references__text\" id=\"ref-CR9\">Handler, R., Sharma, S. &amp; Hernandez-Boussard, T. The fragile intelligence of GPT-5 in medicine. Nat. Med. <b>31<\/b>, 3968\u20133970 (2025).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41591-025-04008-8\" data-track-item_id=\"10.1038\/s41591-025-04008-8\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41591-025-04008-8\" aria-label=\"Article reference 9\" data-doi=\"10.1038\/s41591-025-04008-8\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"cas reference\" data-track-action=\"cas reference\" href=\"https:\/\/www.nature.com\/articles\/cas-redirect\/1:CAS:528:DC%2BB2MXisFKhs7zK\" aria-label=\"CAS reference 9\" target=\"_blank\">CAS<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=41102561\" aria-label=\"PubMed reference 9\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 9\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=The%20fragile%20intelligence%20of%20GPT-5%20in%20medicine&amp;journal=Nat.%20Med.&amp;doi=10.1038%2Fs41591-025-04008-8&amp;volume=31&amp;pages=3968-3970&amp;publication_year=2025&amp;author=Handler%2CR&amp;author=Sharma%2CS&amp;author=Hernandez-Boussard%2CT\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"10.\">\n<p class=\"c-article-references__text\" id=\"ref-CR10\">Farquhar, S., Kossen, J., Kuhn, L. &amp; Gal, Y. Detecting hallucinations in large language models using semantic entropy. Nature <b>630<\/b>, 625\u2013630 (2024).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41586-024-07421-0\" data-track-item_id=\"10.1038\/s41586-024-07421-0\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41586-024-07421-0\" aria-label=\"Article reference 10\" data-doi=\"10.1038\/s41586-024-07421-0\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"cas reference\" data-track-action=\"cas reference\" href=\"https:\/\/www.nature.com\/articles\/cas-redirect\/1:CAS:528:DC%2BB2cXhtlKms7%2FK\" aria-label=\"CAS reference 10\" target=\"_blank\">CAS<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=38898292\" aria-label=\"PubMed reference 10\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed central reference\" data-track-action=\"pubmed central reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC11186750\" aria-label=\"PubMed Central reference 10\" target=\"_blank\">PubMed Central<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 10\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=Detecting%20hallucinations%20in%20large%20language%20models%20using%20semantic%20entropy&amp;journal=Nature&amp;doi=10.1038%2Fs41586-024-07421-0&amp;volume=630&amp;pages=625-630&amp;publication_year=2024&amp;author=Farquhar%2CS&amp;author=Kossen%2CJ&amp;author=Kuhn%2CL&amp;author=Gal%2CY\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"11.\">\n<p class=\"c-article-references__text\" id=\"ref-CR11\">Jin, Q. et al. Hidden flaws behind expert-level accuracy of multimodal GPT-4 vision in medicine. NPJ Digit. Med. <b>7<\/b>, 190 (2024).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41746-024-01185-7\" data-track-item_id=\"10.1038\/s41746-024-01185-7\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41746-024-01185-7\" aria-label=\"Article reference 11\" data-doi=\"10.1038\/s41746-024-01185-7\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=39043988\" aria-label=\"PubMed reference 11\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed central reference\" data-track-action=\"pubmed central reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC11266508\" aria-label=\"PubMed Central reference 11\" target=\"_blank\">PubMed Central<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 11\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=Hidden%20flaws%20behind%20expert-level%20accuracy%20of%20multimodal%20GPT-4%20vision%20in%20medicine&amp;journal=NPJ%20Digit.%20Med.&amp;doi=10.1038%2Fs41746-024-01185-7&amp;volume=7&amp;publication_year=2024&amp;author=Jin%2CQ\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"12.\">\n<p class=\"c-article-references__text\" id=\"ref-CR12\">Pfau, J., Merrill, W. &amp; Bowman, S. R. Let\u2019s think dot by dot: hidden computation in transformer language models. In First Conference on Language Modeling (COLM) <a href=\"https:\/\/openreview.net\/forum?id=NikbrdtYvG\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/openreview.net\/forum?id=NikbrdtYvG\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/openreview.net\/forum?id=NikbrdtYvG<\/a> (2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"13.\">\n<p class=\"c-article-references__text\" id=\"ref-CR13\">Geirhos, R. et al. Shortcut learning in deep neural networks. Nat. Mach. Intell. <b>2<\/b>, 665\u2013673 (2020).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s42256-020-00257-z\" data-track-item_id=\"10.1038\/s42256-020-00257-z\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs42256-020-00257-z\" aria-label=\"Article reference 13\" data-doi=\"10.1038\/s42256-020-00257-z\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 13\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=Shortcut%20learning%20in%20deep%20neural%20networks&amp;journal=Nat.%20Mach.%20Intell.&amp;doi=10.1038%2Fs42256-020-00257-z&amp;volume=2&amp;pages=665-673&amp;publication_year=2020&amp;author=Geirhos%2CR\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"14.\">\n<p class=\"c-article-references__text\" id=\"ref-CR14\">Acosta, J. N., Falcone, G. J., Rajpurkar, P. &amp; Topol, E. J. Multimodal biomedical AI. Nat. Med. <b>28<\/b>, 1773\u20131784 (2022).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41591-022-01981-2\" data-track-item_id=\"10.1038\/s41591-022-01981-2\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41591-022-01981-2\" aria-label=\"Article reference 14\" data-doi=\"10.1038\/s41591-022-01981-2\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"cas reference\" data-track-action=\"cas reference\" href=\"https:\/\/www.nature.com\/articles\/cas-redirect\/1:CAS:528:DC%2BB38XisVWnsrnM\" aria-label=\"CAS reference 14\" target=\"_blank\">CAS<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=36109635\" aria-label=\"PubMed reference 14\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 14\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=Multimodal%20biomedical%20AI&amp;journal=Nat.%20Med.&amp;doi=10.1038%2Fs41591-022-01981-2&amp;volume=28&amp;pages=1773-1784&amp;publication_year=2022&amp;author=Acosta%2CJN&amp;author=Falcone%2CGJ&amp;author=Rajpurkar%2CP&amp;author=Topol%2CEJ\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"15.\">\n<p class=\"c-article-references__text\" id=\"ref-CR15\">Goodfellow, I. J., Shlens, J. &amp; Szegedy, C. Explaining and harnessing adversarial examples. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/1412.6572\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/1412.6572\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/1412.6572<\/a> (2015).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"16.\">\n<p class=\"c-article-references__text\" id=\"ref-CR16\">Szegedy, C. et al. Intriguing properties of neural networks. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/1312.6199\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/1312.6199\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/1312.6199<\/a> (2013).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"17.\">\n<p class=\"c-article-references__text\" id=\"ref-CR17\">The New England Journal of Medicine: Image Challenge. <a href=\"https:\/\/www.nejm.org\/image-challenge\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/www.nejm.org\/image-challenge\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/www.nejm.org\/image-challenge<\/a> (2026).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"18.\">\n<p class=\"c-article-references__text\" id=\"ref-CR18\">JAMA Network Clinical Challenge. <a href=\"https:\/\/jamanetwork.com\/collections\/44038\/clinical-challenge\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/jamanetwork.com\/collections\/44038\/clinical-challenge\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/jamanetwork.com\/collections\/44038\/clinical-challenge<\/a> (2026).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"19.\">\n<p class=\"c-article-references__text\" id=\"ref-CR19\">Comanici, G. et al. Gemini 2.5: pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2507.06261\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2507.06261\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2507.06261<\/a> (2025).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"20.\">\n<p class=\"c-article-references__text\" id=\"ref-CR20\">Anthropic. Claude 3.5 Sonnet. <a href=\"https:\/\/www.anthropic.com\/news\/claude-3-5-sonnet\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/www.anthropic.com\/news\/claude-3-5-sonnet\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/www.anthropic.com\/news\/claude-3-5-sonnet<\/a> (2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"21.\">\n<p class=\"c-article-references__text\" id=\"ref-CR21\">OpenAI. GPT-4o system card. <a href=\"http:\/\/openai.com\/index\/gpt-4o-system-card\/\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"http:\/\/openai.com\/index\/gpt-4o-system-card\/\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/openai.com\/index\/gpt-4o-system-card\/<\/a> (2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"22.\">\n<p class=\"c-article-references__text\" id=\"ref-CR22\">OpenAI. OpenAI o3 and o4-mini system card. <a href=\"https:\/\/openai.com\/index\/o3-o4-mini-system-card\/\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/openai.com\/index\/o3-o4-mini-system-card\/\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/openai.com\/index\/o3-o4-mini-system-card\/<\/a> (2025).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"23.\">\n<p class=\"c-article-references__text\" id=\"ref-CR23\">Wei, J. et al. Chain-of-thought prompting elicits reasoning in large language models. In NIPS\u02bc22: Proceedings of the 36th International Conference on Neural Information Processing Systems 24824\u221224837 (eds Koyejo, S. et al.) (Curran Associates, 2022).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"24.\">\n<p class=\"c-article-references__text\" id=\"ref-CR24\">Lau, J. J., Gayen, S., Ben Abacha, A. &amp; Demner-Fushman, D. A dataset of clinically generated visual questions and answers about radiology images. Sci. Data <b>5<\/b>, 180251 (2018).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/sdata.2018.251\" data-track-item_id=\"10.1038\/sdata.2018.251\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fsdata.2018.251\" aria-label=\"Article reference 24\" data-doi=\"10.1038\/sdata.2018.251\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=30457565\" aria-label=\"PubMed reference 24\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed central reference\" data-track-action=\"pubmed central reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC6244189\" aria-label=\"PubMed Central reference 24\" target=\"_blank\">PubMed Central<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 24\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=A%20dataset%20of%20clinically%20generated%20visual%20questions%20and%20answers%20about%20radiology%20images&amp;journal=Sci.%20Data&amp;doi=10.1038%2Fsdata.2018.251&amp;volume=5&amp;publication_year=2018&amp;author=Lau%2CJJ&amp;author=Gayen%2CS&amp;author=Abacha%2CA&amp;author=Demner-Fushman%2CD\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"25.\">\n<p class=\"c-article-references__text\" id=\"ref-CR25\">Hu, Y. et al. OmniMedVQA: a new large-scale comprehensive evaluation benchmark for medical LVLM. In 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) <a href=\"https:\/\/doi.org\/10.1109\/CVPR52733.2024.02093\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"10.1109\/CVPR52733.2024.02093\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/doi.org\/10.1109\/CVPR52733.2024.02093<\/a> (IEEE, 2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"26.\">\n<p class=\"c-article-references__text\" id=\"ref-CR26\">Johnson, A. E. et al. MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports. Sci. Data <b>6<\/b>, 317 (2019).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1038\/s41597-019-0322-0\" data-track-item_id=\"10.1038\/s41597-019-0322-0\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1038%2Fs41597-019-0322-0\" aria-label=\"Article reference 26\" data-doi=\"10.1038\/s41597-019-0322-0\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed reference\" data-track-action=\"pubmed reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/entrez\/query.fcgi?cmd=Retrieve&amp;db=PubMed&amp;dopt=Abstract&amp;list_uids=31831740\" aria-label=\"PubMed reference 26\" target=\"_blank\">PubMed<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"link\" data-track-item_id=\"link\" data-track-value=\"pubmed central reference\" data-track-action=\"pubmed central reference\" href=\"http:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC6908718\" aria-label=\"PubMed Central reference 26\" target=\"_blank\">PubMed Central<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 26\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=MIMIC-CXR%2C%20a%20de-identified%20publicly%20available%20database%20of%20chest%20radiographs%20with%20free-text%20reports&amp;journal=Sci.%20Data&amp;doi=10.1038%2Fs41597-019-0322-0&amp;volume=6&amp;publication_year=2019&amp;author=Johnson%2CAE\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"27.\">\n<p class=\"c-article-references__text\" id=\"ref-CR27\">He, X., Zhang, Y., Mou, L., Xing, E. &amp; Xie, P. PathVQA: 30000+ questions for medical visual question answering. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2003.10286\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2003.10286\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2003.10286<\/a> (2020).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"28.\">\n<p class=\"c-article-references__text\" id=\"ref-CR28\">Liu, B. et al. SLAKE: a semantically-labeled knowledge-enhanced dataset for medical visual question answering. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2102.09542\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2102.09542\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2102.09542<\/a> (2021).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"29.\">\n<p class=\"c-article-references__text\" id=\"ref-CR29\">Zhang, X. et al. PMC-VQA: visual instruction tuning for medical visual question answering. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2305.10415\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2305.10415\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2305.10415<\/a> (2023).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"30.\">\n<p class=\"c-article-references__text\" id=\"ref-CR30\">Yue, X. et al. MMMU: a massive multidiscipline multimodal understanding and reasoning benchmark for expert AGI. In 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) <a href=\"https:\/\/doi.org\/10.1109\/CVPR52733.2024.00913\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"10.1109\/CVPR52733.2024.00913\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/doi.org\/10.1109\/CVPR52733.2024.00913<\/a> (IEEE, 2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"31.\">\n<p class=\"c-article-references__text\" id=\"ref-CR31\">Fleiss, J. L. Measuring nominal scale agreement among many raters. Psychol. Bull. <b>76<\/b>, 378\u2013382 (1971).<\/p>\n<p class=\"c-article-references__links u-hide-print\"><a data-track=\"click_references\" rel=\"nofollow noopener\" data-track-label=\"10.1037\/h0031619\" data-track-item_id=\"10.1037\/h0031619\" data-track-value=\"article reference\" data-track-action=\"article reference\" href=\"https:\/\/doi.org\/10.1037%2Fh0031619\" aria-label=\"Article reference 31\" data-doi=\"10.1037\/h0031619\" target=\"_blank\">Article<\/a>\u00a0<br \/>\n    <a data-track=\"click_references\" data-track-action=\"google scholar reference\" data-track-value=\"google scholar reference\" data-track-label=\"link\" data-track-item_id=\"link\" rel=\"nofollow noopener\" aria-label=\"Google Scholar reference 31\" href=\"http:\/\/scholar.google.com\/scholar_lookup?&amp;title=Measuring%20nominal%20scale%20agreement%20among%20many%20raters&amp;journal=Psychol.%20Bull.&amp;doi=10.1037%2Fh0031619&amp;volume=76&amp;pages=378-382&amp;publication_year=1971&amp;author=Fleiss%2CJL\" target=\"_blank\"><br \/>\n                    Google Scholar<\/a>\u00a0\n                <\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"32.\">\n<p class=\"c-article-references__text\" id=\"ref-CR32\">Wu, Z. et al. DeepSeek-VL2: mixture-of-experts vision-language models for advanced multimodal understanding. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2412.10302\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2412.10302\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2412.10302<\/a> (2024).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"33.\">\n<p class=\"c-article-references__text\" id=\"ref-CR33\">Bai, S. et al. Qwen3-VL technical report. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2511.21631\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2511.21631\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2511.21631<\/a> (2025).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"34.\">\n<p class=\"c-article-references__text\" id=\"ref-CR34\">Li, C. et al. LLaVA-Med: training a large language-and-vision assistant for biomedicine in one day. In NIPS \u02bc23: Proceedings of the 37th International Conference on Neural Information Processing Systems (eds Oh, A. et al.) 28541\u221228564 (Curran Associates, 2023).<\/p>\n<\/li>\n<li class=\"c-article-references__item js-c-reading-companion-references-item\" data-counter=\"35.\">\n<p class=\"c-article-references__text\" id=\"ref-CR35\">Sellergren, A. et al. MedGemma technical report. Preprint at <a href=\"https:\/\/arxiv.org\/abs\/2507.05201\" data-track=\"click_references\" data-track-action=\"external reference\" data-track-value=\"external reference\" data-track-label=\"https:\/\/arxiv.org\/abs\/2507.05201\" rel=\"nofollow noopener\" target=\"_blank\">https:\/\/arxiv.org\/abs\/2507.05201<\/a> (2025).<\/p>\n<\/li>\n","protected":false},"excerpt":{"rendered":"Singhal, K. et al. Large language models encode clinical knowledge. Nature 620, 172\u2013180 (2023). Article\u00a0 CAS\u00a0 PubMed\u00a0 PubMed&hellip;\n","protected":false},"author":3,"featured_media":894346,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_share_on_mastodon":"0"},"categories":[35],"tags":[15576,6958,834,210,1141,1142,6454,3740,17781,913,911,67,132,68],"class_list":["post-894345","post","type-post","status-publish","format-standard","has-post-thumbnail","category-health-care","tag-biomedicine","tag-cancer-research","tag-general","tag-health","tag-health-care","tag-healthcare","tag-infectious-diseases","tag-medical-research","tag-metabolic-diseases","tag-molecular-medicine","tag-neurosciences","tag-united-states","tag-unitedstates","tag-us"],"share_on_mastodon":{"url":"https:\/\/pubeurope.com\/@us\/116816999044784070","error":""},"_links":{"self":[{"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/posts\/894345","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/users\/3"}],"replies":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/comments?post=894345"}],"version-history":[{"count":0,"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/posts\/894345\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/media\/894346"}],"wp:attachment":[{"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/media?parent=894345"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/categories?post=894345"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.europesays.com\/us\/wp-json\/wp\/v2\/tags?post=894345"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}