{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,15]],"date-time":"2026-08-15T02:41:13Z","timestamp":1786761673616,"version":"build-2736575974"},"reference-count":191,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2025,5,13]],"date-time":"2025-05-13T00:00:00Z","timestamp":1747094400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Medical Image Analysis"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1016\/j.media.2025.103627","type":"journal-article","created":{"date-parts":[[2025,5,13]],"date-time":"2025-05-13T11:10:57Z","timestamp":1747134657000},"page":"103627","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":31,"special_numbering":"C","title":["A survey of deep-learning-based radiology report generation using multimodal inputs"],"prefix":"10.1016","volume":"103","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-7870-5374","authenticated-orcid":false,"given":"Xinyi","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4094-7680","authenticated-orcid":false,"given":"Grazziela","family":"Figueredo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4697-8947","authenticated-orcid":false,"given":"Ruizhe","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0406-5974","authenticated-orcid":false,"given":"Wei Emma","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weitong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3685-0854","authenticated-orcid":false,"given":"Xin","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.media.2025.103627_b1","series-title":"AI 2022: Advances in Artificial Intelligence: 35th Australasian Joint Conference, AI 2022, Perth, WA, Australia, December 5\u20138, 2022, Proceedings","first-page":"530","article-title":"Automated radiology report generation using a transformer-template system: Improved clinical accuracy and an assessment of clinical safety","author":"Abela","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.imu.2021.100557","article-title":"Automated radiology report generation using conditioned transformers","volume":"24","author":"Alfarghaly","year":"2021","journal-title":"Inform. Med. Unlocked"},{"key":"10.1016\/j.media.2025.103627_b3","series-title":"MiniGPT-Med: Large language model as a general interface for radiology diagnosis","author":"Alkhaldi","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b4","doi-asserted-by":"crossref","unstructured":"Alsentzer, E., Murphy, J., Boag, W., Weng, W.H., Jindi, D., Naumann, T., McDermott, M., 2019. Publicly Available Clinical BERT Embeddings. In: Proceedings of the 2nd Clinical Natural Language Processing Workshop. pp. 72\u201378.","DOI":"10.18653\/v1\/W19-1909"},{"issue":"11","key":"10.1016\/j.media.2025.103627_b5","doi-asserted-by":"crossref","DOI":"10.1371\/journal.pone.0259639","article-title":"Encoder-decoder models for chest X-ray report generation perform no better than unconditioned baselines","volume":"16","author":"Babar","year":"2021","journal-title":"Plos One"},{"key":"10.1016\/j.media.2025.103627_b6","doi-asserted-by":"crossref","DOI":"10.1016\/j.artmed.2021.102075","article-title":"Evaluating diagnostic content of AI-generated radiology reports of chest X-rays","volume":"116","author":"Babar","year":"2021","journal-title":"Artif. Intell. Med."},{"key":"10.1016\/j.media.2025.103627_b7","unstructured":"Banerjee, S., Lavie, A., 2005. METEOR: An automatic metric for MT evaluation with improved correlation with human judgments. In: Proceedings of the Acl Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/Or Summarization. pp. 65\u201372."},{"key":"10.1016\/j.media.2025.103627_b8","series-title":"MAIRA-2: Grounded radiology report generation","author":"Bannur","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b9","doi-asserted-by":"crossref","unstructured":"Bannur, S., Hyland, S., Liu, Q., Perez-Garcia, F., Ilse, M., Castro, D.C., Boecking, B., Sharma, H., Bouzid, K., Thieme, A., et al., 2023. Learning to exploit temporal structure for biomedical vision-language processing. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 15016\u201315027.","DOI":"10.1109\/CVPR52729.2023.01442"},{"issue":"5","key":"10.1016\/j.media.2025.103627_b10","doi-asserted-by":"crossref","first-page":"4019","DOI":"10.1007\/s10462-022-10270-w","article-title":"Automatic captioning for medical imaging (MIC): a rapid review of literature","volume":"56","author":"Beddiar","year":"2023","journal-title":"Artif. Intell. Rev."},{"key":"10.1016\/j.media.2025.103627_b11","series-title":"Do lateral views help automated chest X-ray predictions?","author":"Bertrand","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b12","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2025.103627_b13","series-title":"Database Systems for Advanced Applications: 27th International Conference, DASFAA 2022, Virtual Event, April 11\u201314, 2022, Proceedings, Part III","first-page":"117","article-title":"Kdtnet: medical image report generation via knowledge-driven transformer","author":"Cao","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b14","series-title":"International Conference on Database Systems for Advanced Applications","first-page":"415","article-title":"CMT: Cross-modal memory transformer for medical image report generation","author":"Cao","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b15","series-title":"CheXpert plus: Augmenting a large chest X-ray dataset with text radiology reports, patient demographics and additional image formats","author":"Chambon","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b16","series-title":"PRICAI 2022: Trends in Artificial Intelligence: 19th Pacific Rim International Conference on Artificial Intelligence, PRICAI 2022, Shanghai, China, November 10\u201313, 2022, Proceedings, Part I","first-page":"188","article-title":"VMEKNet: Visual memory and external knowledge based network for medical report generation","author":"Chen","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b17","doi-asserted-by":"crossref","unstructured":"Chen, Z., Shen, Y., Song, Y., Wan, X., 2021. Cross-modal Memory Networks for Radiology Report Generation. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). pp. 5904\u20135914.","DOI":"10.18653\/v1\/2021.acl-long.459"},{"key":"10.1016\/j.media.2025.103627_b18","doi-asserted-by":"crossref","unstructured":"Chen, Z., Song, Y., Chang, T.H., Wan, X., 2020. Generating Radiology Reports via Memory-driven Transformer. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing. EMNLP, pp. 1439\u20131449.","DOI":"10.18653\/v1\/2020.emnlp-main.112"},{"key":"10.1016\/j.media.2025.103627_b19","series-title":"Chexagent: Towards a foundation model for chest X-ray interpretation","author":"Chen","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b20","series-title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","first-page":"6","author":"Chiang","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b21","doi-asserted-by":"crossref","unstructured":"Cornia, M., Stefanini, M., Baraldi, L., Cucchiara, R., 2020. Meshed-memory transformer for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 10578\u201310587.","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"10.1016\/j.media.2025.103627_b22","doi-asserted-by":"crossref","unstructured":"Dalla Serra, F., Clackett, W., MacKinnon, H., Wang, C., Deligianni, F., Dalton, J., O\u2019Neil, A.Q., 2022. Multimodal Generation of Radiology Reports using Knowledge-Grounded Extraction of Entities and Relations. In: Proceedings of the 2nd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 12th International Joint Conference on Natural Language Processing. pp. 615\u2013624.","DOI":"10.18653\/v1\/2022.aacl-main.47"},{"key":"10.1016\/j.media.2025.103627_b23","doi-asserted-by":"crossref","unstructured":"Dalla Serra, F., Wang, C., Deligianni, F., Dalton, J., O\u2019Neil, A.Q., 2023a. Controllable chest X-ray report generation from longitudinal representations. In: The 2023 Conference on Empirical Methods in Natural Language Processing.","DOI":"10.18653\/v1\/2023.findings-emnlp.325"},{"key":"10.1016\/j.media.2025.103627_b24","series-title":"International Workshop on Machine Learning in Medical Imaging","first-page":"413","article-title":"Finding-aware anatomical tokens for chest X-ray automated reporting","author":"Dalla Serra","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b25","doi-asserted-by":"crossref","unstructured":"Delbrouck, J.B., Chambon, P., Bluethgen, C., Tsai, E., Almusa, O., Langlotz, C., 2022. Improving the Factual Correctness of Radiology Report Generation with Semantic Rewards. In: Findings of the Association for Computational Linguistics. EMNLP 2022, pp. 4348\u20134360.","DOI":"10.18653\/v1\/2022.findings-emnlp.319"},{"key":"10.1016\/j.media.2025.103627_b26","series-title":"Findings of the Association for Computational Linguistics ACL 2024","first-page":"12902","article-title":"RadGraph-XL: A large-scale expert-annotated dataset for entity and relation extraction from radiology reports","author":"Delbrouck","year":"2024"},{"issue":"2","key":"10.1016\/j.media.2025.103627_b27","doi-asserted-by":"crossref","first-page":"304","DOI":"10.1093\/jamia\/ocv080","article-title":"Preparing a collection of radiology examinations for distribution and retrieval","volume":"23","author":"Demner-Fushman","year":"2016","journal-title":"J. Am. Med. Informatics Assoc."},{"key":"10.1016\/j.media.2025.103627_b28","series-title":"Towards a rigorous science of interpretable machine learning","author":"Doshi-Velez","year":"2017"},{"key":"10.1016\/j.media.2025.103627_b29","series-title":"Asia-Pacific Web (APWeb) and Web-Age Information Management (WAIM) Joint International Conference on Web and Big Data","first-page":"520","article-title":"Automatic report generation method based on multiscale feature extraction and word attention network","author":"Du","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b30","series-title":"Machine Learning for Health","first-page":"209","article-title":"Retrieval-based chest X-ray report generation using a pre-trained contrastive language-image model","author":"Endo","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b31","doi-asserted-by":"crossref","unstructured":"Esser, P., Rombach, R., Ommer, B., 2021. Taming transformers for high-resolution image synthesis. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 12873\u201312883.","DOI":"10.1109\/CVPR46437.2021.01268"},{"key":"10.1016\/j.media.2025.103627_b32","doi-asserted-by":"crossref","DOI":"10.1016\/j.cmpb.2022.106853","article-title":"Translating medical image to radiological report: Adaptive multilevel multi-attention approach","volume":"221","author":"Gajbhiye","year":"2022","journal-title":"Comput. Methods Programs Biomed."},{"key":"10.1016\/j.media.2025.103627_b33","series-title":"International Conference on Machine Learning","first-page":"1050","article-title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","author":"Gal","year":"2016"},{"key":"10.1016\/j.media.2025.103627_b34","doi-asserted-by":"crossref","unstructured":"Gu, T., Liu, D., Li, Z., Cai, W., 2024. Complex Organ Mask Guided Radiology Report Generation. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision. pp. 7995\u20138004.","DOI":"10.1109\/WACV57701.2024.00781"},{"key":"10.1016\/j.media.2025.103627_b35","series-title":"ACM Multimedia 2024","article-title":"LLaVA-ultra: Large Chinese language and vision assistant for ultrasound","author":"Guo","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b36","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2020.101872","article-title":"Unifying neural learning and symbolic reasoning for spinal medical report generation","volume":"67","author":"Han","year":"2021","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b37","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S., Girshick, R., 2020. Momentum contrast for unsupervised visual representation learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 9729\u20139738.","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"10.1016\/j.media.2025.103627_b38","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J., 2016. Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"10.1016\/j.media.2025.103627_b39","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","article-title":"Long short-term memory","volume":"9","author":"Hochreiter","year":"1997","journal-title":"Neural Comput."},{"key":"10.1016\/j.media.2025.103627_b40","doi-asserted-by":"crossref","first-page":"843","DOI":"10.1007\/s10278-013-9597-4","article-title":"Content analysis of reporting templates and free-text radiology reports","volume":"26","author":"Hong","year":"2013","journal-title":"J. Digit. Imaging"},{"issue":"8","key":"10.1016\/j.media.2025.103627_b41","doi-asserted-by":"crossref","first-page":"500","DOI":"10.1038\/s41568-018-0016-5","article-title":"Artificial intelligence in radiology","volume":"18","author":"Hosny","year":"2018","journal-title":"Nat. Rev. Cancer"},{"key":"10.1016\/j.media.2025.103627_b42","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part VII 24","first-page":"293","article-title":"Ratchet: Medical transformer for chest X-ray diagnosis and reporting","author":"Hou","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b43","series-title":"ORGAN: observation-guided radiology report generation via tree reasoning","author":"Hou","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b44","doi-asserted-by":"crossref","first-page":"21236","DOI":"10.1109\/ACCESS.2021.3056175","article-title":"Automatic report generation for chest X-ray images via adversarial reinforcement learning","volume":"9","author":"Hou","year":"2021","journal-title":"IEEE Access"},{"key":"10.1016\/j.media.2025.103627_b45","series-title":"Lora: Low-rank adaptation of large language models","author":"Hu","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b46","doi-asserted-by":"crossref","unstructured":"Huang, G., Liu, Z., Van Der Maaten, L., Weinberger, K.Q., 2017. Densely connected convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 4700\u20134708.","DOI":"10.1109\/CVPR.2017.243"},{"key":"10.1016\/j.media.2025.103627_b47","doi-asserted-by":"crossref","unstructured":"Huang, J.H., Wu, T.W., Yang, C.-H.H., Shi, Z., Lin, I., Tegner, J., Worring, M., et al., 2022. Non-local attention improves description generation for retinal images. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision. pp. 1606\u20131615.","DOI":"10.1109\/WACV51458.2022.00331"},{"key":"10.1016\/j.media.2025.103627_b48","series-title":"2021 IEEE International Conference on Image Processing","first-page":"3762","article-title":"Deep context-encoding network for retinal image captioning","author":"Huang","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b49","doi-asserted-by":"crossref","unstructured":"Huang, J.H., Yang, C.-H.H., Liu, F., Tian, M., Liu, Y.C., Wu, T.W., Lin, I., Wang, K., Morikawa, H., Chang, H., et al., 2021b. Deepopht: medical report generation for retinal images via deep models and visual explanation. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision. pp. 2442\u20132452.","DOI":"10.1109\/WACV48630.2021.00249"},{"key":"10.1016\/j.media.2025.103627_b50","doi-asserted-by":"crossref","unstructured":"Huang, Z., Zhang, X., Zhang, S., 2023. KiUT: Knowledge-injected U-Transformer for Radiology Report Generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 19809\u201319818.","DOI":"10.1109\/CVPR52729.2023.01897"},{"key":"10.1016\/j.media.2025.103627_b51","series-title":"Maira-1: A specialised large multimodal model for radiology report generation","author":"Hyland","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b52","first-page":"590","article-title":"Chexpert: A large chest radiograph dataset with uncertainty labels and expert comparison","volume":"vol. 33","author":"Irvin","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b53","series-title":"Radgraph: Extracting clinical entities and relations from radiology reports","author":"Jain","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b54","series-title":"Medical Imaging with Deep Learning","first-page":"978","article-title":"Multimodal image-text matching improves retrieval-based chest X-ray report generation","author":"Jeong","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b55","series-title":"IEEE International Conference on Bioinformatics and Biomedicine","first-page":"1347","article-title":"Radiology report generation for rare diseases via few-shot transformer","author":"Jia","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b56","series-title":"2022 IEEE International Conference on Bioinformatics and Biomedicine","first-page":"1574","article-title":"Few-shot radiology report generation via knowledge transfer and multi-modal alignment","author":"Jia","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b57","series-title":"Mistral 7B","author":"Jiang","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b58","first-page":"2607","article-title":"Promptmrg: Diagnosis-driven prompts for medical report generation","volume":"vol. 38","author":"Jin","year":"2024"},{"issue":"1","key":"10.1016\/j.media.2025.103627_b59","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1038\/s41597-019-0322-0","article-title":"MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports","volume":"6","author":"Johnson","year":"2019","journal-title":"Sci. Data"},{"key":"10.1016\/j.media.2025.103627_b60","series-title":"MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs","author":"Johnson","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b61","first-page":"1","article-title":"An evaluation framework for clinical use of large language models in patient interaction tasks","author":"Johri","year":"2025","journal-title":"Nature Med."},{"issue":"5","key":"10.1016\/j.media.2025.103627_b62","doi-asserted-by":"crossref","first-page":"e61","DOI":"10.1093\/cid\/ciw353","article-title":"Management of adults with hospital-acquired and ventilator-associated pneumonia: 2016 clinical practice guidelines by the Infectious Diseases Society of America and the American Thoracic Society","volume":"63","author":"Kalil","year":"2016","journal-title":"Clin. Infect. Dis."},{"key":"10.1016\/j.media.2025.103627_b63","doi-asserted-by":"crossref","DOI":"10.1016\/j.compbiomed.2022.105498","article-title":"CADxReport: Chest X-ray report generation using co-attention mechanism and reinforcement learning","volume":"145","author":"Kaur","year":"2022","journal-title":"Comput. Biol. Med."},{"key":"10.1016\/j.media.2025.103627_b64","doi-asserted-by":"crossref","DOI":"10.1016\/j.jbi.2022.104220","article-title":"RadioBERT: A deep learning-based system for medical report generation from chest X-ray images using contextual embeddings","volume":"135","author":"Kaur","year":"2022","journal-title":"J. Biomed. Inform."},{"issue":"10","key":"10.1016\/j.media.2025.103627_b65","doi-asserted-by":"crossref","first-page":"13409","DOI":"10.1007\/s11042-021-11272-6","article-title":"Methods for automatic generation of radiological reports of chest radiographs: a comprehensive survey","volume":"81","author":"Kaur","year":"2022","journal-title":"Multimedia Tools Appl."},{"key":"10.1016\/j.media.2025.103627_b66","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1186\/s12916-019-1426-2","article-title":"Key challenges for delivering clinical impact with artificial intelligence","volume":"17","author":"Kelly","year":"2019","journal-title":"BMC Med."},{"key":"10.1016\/j.media.2025.103627_b67","series-title":"Auto-encoding variational bayes","author":"Kingma","year":"2013"},{"key":"10.1016\/j.media.2025.103627_b68","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., et al., 2023. Segment anything. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 4015\u20134026.","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"10.1016\/j.media.2025.103627_b69","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2022: 25th International Conference, Singapore, September 18\u201322, 2022, Proceedings, Part VIII","first-page":"610","article-title":"TranSQ: Transformer-based semantic query for medical report generation","author":"Kong","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b70","doi-asserted-by":"crossref","DOI":"10.1016\/j.artmed.2024.102830","article-title":"Trustworthy clinical AI solutions: a unified review of uncertainty quantification in deep learning models for medical image analysis","author":"Lambert","year":"2024","journal-title":"Artif. Intell. Med."},{"issue":"6","key":"10.1016\/j.media.2025.103627_b71","doi-asserted-by":"crossref","first-page":"1595","DOI":"10.1148\/rg.266065168","article-title":"RadLex: a new method for indexing online educational materials","volume":"26","author":"Langlotz","year":"2006","journal-title":"Radiographics"},{"key":"10.1016\/j.media.2025.103627_b72","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2018: 21st International Conference, Granada, Spain, September 16\u201320, 2018, Proceedings, Part II 11","first-page":"553","article-title":"Textray: Mining clinical reports to gain a broad understanding of chest X-rays","author":"Laserson","year":"2018"},{"issue":"4","key":"10.1016\/j.media.2025.103627_b73","doi-asserted-by":"crossref","first-page":"1429","DOI":"10.3390\/s22041429","article-title":"Cross encoder-decoder transformer with global-local visual extractor for medical image captioning","volume":"22","author":"Lee","year":"2022","journal-title":"Sensors"},{"key":"10.1016\/j.media.2025.103627_b74","series-title":"LLM-CXR: Instruction-finetuned LLM for CXR image understanding and generation","author":"Lee","year":"2023"},{"issue":"4","key":"10.1016\/j.media.2025.103627_b75","doi-asserted-by":"crossref","first-page":"1234","DOI":"10.1093\/bioinformatics\/btz682","article-title":"BioBERT: a pre-trained biomedical language representation model for biomedical text mining","volume":"36","author":"Lee","year":"2020","journal-title":"Bioinformatics"},{"key":"10.1016\/j.media.2025.103627_b76","unstructured":"Li, M., Cai, W., Liu, R., Weng, Y., Zhao, X., Wang, C., Chen, X., Liu, Z., Pan, C., Li, M., et al., 2021. Ffa-ir: Towards an explainable and reliable medical report generation benchmark. In: Thirty-Fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 2)."},{"key":"10.1016\/j.media.2025.103627_b77","doi-asserted-by":"crossref","unstructured":"Li, M., Cai, W., Verspoor, K., Pan, S., Liang, X., Chang, X., 2022a. Cross-modal clinical graph transformer for ophthalmic report generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 20656\u201320665.","DOI":"10.1109\/CVPR52688.2022.02000"},{"key":"10.1016\/j.media.2025.103627_b78","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2022: 25th International Conference, Singapore, September 18\u201322, 2022, Proceedings, Part VIII","first-page":"588","article-title":"A self-guided framework for radiology report generation","author":"Li","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b79","series-title":"International Conference on Machine Learning","first-page":"19730","article-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b80","doi-asserted-by":"crossref","unstructured":"Li, M., Lin, B., Chen, Z., Lin, H., Liang, X., Chang, X., 2023b. Dynamic Graph Enhanced Contrastive Learning for Chest X-ray Report Generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 3334\u20133343.","DOI":"10.1109\/CVPR52729.2023.00325"},{"issue":"1","key":"10.1016\/j.media.2025.103627_b81","doi-asserted-by":"crossref","first-page":"253","DOI":"10.1007\/s11280-022-01013-6","article-title":"Auxiliary signal-guided knowledge encoder-decoder for medical report generation","volume":"26","author":"Li","year":"2023","journal-title":"World Wide Web"},{"key":"10.1016\/j.media.2025.103627_b82","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"592","article-title":"Focalunetr: A focal transformer for boundary-aware prostate segmentation using ct images","author":"Li","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b83","series-title":"Auxiliary signal-guided knowledge encoder-decoder for medical report generation","author":"Li","year":"2020"},{"key":"10.1016\/j.media.2025.103627_b84","article-title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","volume":"36","author":"Li","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2025.103627_b85","series-title":"2023 IEEE International Conference on Bioinformatics and Biomedicine","first-page":"2053","article-title":"Enhanced knowledge injection for radiology report generation","author":"Li","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b86","doi-asserted-by":"crossref","unstructured":"Li, Y., Yang, B., Cheng, X., Zhu, Z., Li, H., Zou, Y., 2023f. Unify, align and refine: Multi-level semantic alignment for radiology report generation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 2863\u20132874.","DOI":"10.1109\/ICCV51070.2023.00268"},{"key":"10.1016\/j.media.2025.103627_b87","doi-asserted-by":"crossref","DOI":"10.1016\/j.imu.2023.101273","article-title":"Deep learning approaches to automatic radiology report generation: A systematic review","author":"Liao","year":"2023","journal-title":"Inform. Med. Unlocked"},{"key":"10.1016\/j.media.2025.103627_b88","series-title":"Text Summarization Branches Out","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004"},{"key":"10.1016\/j.media.2025.103627_b89","doi-asserted-by":"crossref","DOI":"10.1016\/j.jbi.2023.104281","article-title":"Contrastive pre-training and linear interaction attention-based transformer for universal medical reports generation","author":"Lin","year":"2023","journal-title":"J. Biomed. Inform."},{"key":"10.1016\/j.media.2025.103627_b90","doi-asserted-by":"crossref","unstructured":"Liu, J., Ding, H., Cai, Z., Zhang, Y., Satzoda, R.K., Mahadevan, V., Manmatha, R., 2023a. Polyformer: Referring image segmentation as sequential polygon generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 18653\u201318663.","DOI":"10.1109\/CVPR52729.2023.01789"},{"key":"10.1016\/j.media.2025.103627_b91","doi-asserted-by":"crossref","unstructured":"Liu, F., Ge, S., Wu, X., 2021a. Competence-based Multimodal Curriculum Learning for Medical Report Generation. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). pp. 3001\u20133012.","DOI":"10.18653\/v1\/2021.acl-long.234"},{"key":"10.1016\/j.media.2025.103627_b92","series-title":"Machine Learning for Healthcare Conference","first-page":"249","article-title":"Clinically accurate chest X-ray report generation","author":"Liu","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b93","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"9","key":"10.1016\/j.media.2025.103627_b94","doi-asserted-by":"crossref","first-page":"3786","DOI":"10.1109\/TNNLS.2021.3099165","article-title":"Medical-vlbert: Medical visual language bert for covid-19 ct report generation with alternate learning","volume":"32","author":"Liu","year":"2021","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.media.2025.103627_b95","series-title":"A systematic review of deep learning-based research on radiology report generation","author":"Liu","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b96","doi-asserted-by":"crossref","unstructured":"Liu, F., Wu, X., Ge, S., Fan, W., Zou, Y., 2021c. Exploring and distilling posterior and prior knowledge for radiology report generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 13753\u201313762.","DOI":"10.1109\/CVPR46437.2021.01354"},{"key":"10.1016\/j.media.2025.103627_b97","doi-asserted-by":"crossref","unstructured":"Liu, F., Yin, C., Wu, X., Ge, S., Zhang, P., Sun, X., 2021d. Contrastive attention for automatic chest X-ray report generation. In: Findings of the Association for Computational Linguistics: ACL-IJCNLP. pp. 269\u2013280.","DOI":"10.18653\/v1\/2021.findings-acl.23"},{"key":"10.1016\/j.media.2025.103627_b98","first-page":"16266","article-title":"Auto-encoding knowledge graph for unsupervised medical report generation","volume":"34","author":"Liu","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"9","key":"10.1016\/j.media.2025.103627_b99","first-page":"1","article-title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","volume":"55","author":"Liu","year":"2023","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.media.2025.103627_b100","article-title":"From observation to concept: A flexible multi-view paradigm for medical report generation","author":"Liu","year":"2023","journal-title":"IEEE Trans. Multimed."},{"issue":"9","key":"10.1016\/j.media.2025.103627_b101","doi-asserted-by":"crossref","first-page":"1191","DOI":"10.1016\/j.acra.2015.05.007","article-title":"The effects of changes in utilization and technological advancements of cross-sectional imaging on radiologist workload","volume":"22","author":"McDonald","year":"2015","journal-title":"Academic Radiol."},{"issue":"10s","key":"10.1016\/j.media.2025.103627_b102","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3522747","article-title":"A survey on deep learning and explainability for automatic report generation from medical images","volume":"54","author":"Messina","year":"2022","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.media.2025.103627_b103","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102863","article-title":"A survey on deep learning for skin lesion segmentation","author":"Mirikharaji","year":"2023","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b104","doi-asserted-by":"crossref","unstructured":"Miura, Y., Zhang, Y., Tsai, E., Langlotz, C., Jurafsky, D., 2021. Improving Factual Completeness and Consistency of Image-to-Text Radiology Report Generation. In: Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. pp. 5288\u20135304.","DOI":"10.18653\/v1\/2021.naacl-main.416"},{"issue":"12","key":"10.1016\/j.media.2025.103627_b105","doi-asserted-by":"crossref","first-page":"6070","DOI":"10.1109\/JBHI.2022.3207502","article-title":"Multi-modal understanding and generation for medical images and text via vision-language pre-training","volume":"26","author":"Moon","year":"2022","journal-title":"IEEE J. Biomed. Heal. Inform."},{"key":"10.1016\/j.media.2025.103627_b106","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part III 24","first-page":"625","article-title":"Variational topic inference for chest X-ray report generation","author":"Najdenkoska","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b107","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2022.102603","article-title":"Uncertainty-aware report generation for chest X-rays by variational topic inference","volume":"82","author":"Najdenkoska","year":"2022","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b108","series-title":"ScispaCy: fast and robust models for biomedical natural language processing","author":"Neumann","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b109","first-page":"1","article-title":"Structured reporting in radiology: a systematic review to explore its potential","author":"Nobel","year":"2022","journal-title":"Eur. Radiol."},{"key":"10.1016\/j.media.2025.103627_b110","series-title":"GREEN: Generative radiology report evaluation and error notation","author":"Ostmeier","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b111","doi-asserted-by":"crossref","unstructured":"Pahwa, E., Mehta, D., Kapadia, S., Jain, D., Luthra, A., 2021. Medskip: Medical report generation using skip connections and integrated attention. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 3409\u20133415.","DOI":"10.1109\/ICCVW54120.2021.00380"},{"key":"10.1016\/j.media.2025.103627_b112","first-page":"34","article-title":"This explains that: Congruent image\u2013report generation for explainable medical image analysis with cyclic generative adversarial networks","author":"Pandey","year":"2021"},{"issue":"1","key":"10.1016\/j.media.2025.103627_b113","doi-asserted-by":"crossref","first-page":"48","DOI":"10.1186\/s12938-023-01113-y","article-title":"A survey on automatic generation of medical imaging reports based on deep learning","volume":"22","author":"Pang","year":"2023","journal-title":"BioMedical Eng. OnLine"},{"key":"10.1016\/j.media.2025.103627_b114","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.J., 2002. Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics. pp. 311\u2013318.","DOI":"10.3115\/1073083.1073135"},{"key":"10.1016\/j.media.2025.103627_b115","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"409","article-title":"Rad-restruct: A novel vqa benchmark and method for structured radiology reporting","author":"Pellegrini","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b116","series-title":"RaDialog: A large vision-language model for radiology report generation and conversational assistance","author":"Pellegrini","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b117","series-title":"RAD-DINO: Exploring scalable medical image encoders beyond text supervision","author":"P\u00e9rez-Garc\u00eda","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b118","series-title":"Machine Learning in Medical Imaging: 12th International Workshop, MLMI 2021, Held in Conjunction with MICCAI 2021, Strasbourg, France, September 27, 2021, Proceedings 12","first-page":"654","article-title":"Clinically correct report generation from chest X-rays using templates","author":"Pino","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b119","doi-asserted-by":"crossref","unstructured":"Qin, H., Song, Y., 2022. Reinforced cross-modal alignment for radiology report generation. In: Findings of the Association for Computational Linguistics. ACL 2022, pp. 448\u2013458.","DOI":"10.18653\/v1\/2022.findings-acl.38"},{"key":"10.1016\/j.media.2025.103627_b120","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b121","series-title":"Machine Learning for Health","first-page":"456","article-title":"Improving radiology report generation systems by removing hallucinated references to non-existent priors","author":"Ramesh","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b122","series-title":"International Conference on Machine Learning","first-page":"8821","article-title":"Zero-shot text-to-image generation","author":"Ramesh","year":"2021"},{"issue":"2","key":"10.1016\/j.media.2025.103627_b123","doi-asserted-by":"crossref","first-page":"545","DOI":"10.1378\/chest.10-1302","article-title":"Interpretation of plain chest roentgenogram","volume":"141","author":"Raoof","year":"2012","journal-title":"Chest"},{"issue":"6","key":"10.1016\/j.media.2025.103627_b124","doi-asserted-by":"crossref","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","volume":"39","author":"Ren","year":"2016","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.media.2025.103627_b125","article-title":"Radiologist shortage leaves patient care at risk, warns royal college","volume":"359","author":"Rimmer","year":"2017","journal-title":"BMJ: Br. Med. J. (Online)"},{"key":"10.1016\/j.media.2025.103627_b126","series-title":"Capabilities of gemini models in medicine","author":"Saab","year":"2024"},{"issue":"1","key":"10.1016\/j.media.2025.103627_b127","doi-asserted-by":"crossref","first-page":"4171","DOI":"10.1038\/s41598-023-31223-5","article-title":"Medical image captioning via generative pretrained transformers","volume":"13","author":"Selivanov","year":"2023","journal-title":"Sci. Rep."},{"key":"10.1016\/j.media.2025.103627_b128","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D., 2017. Grad-cam: Visual explanations from deep networks via gradient-based localization. In: Proceedings of the IEEE International Conference on Computer Vision. pp. 618\u2013626.","DOI":"10.1109\/ICCV.2017.74"},{"key":"10.1016\/j.media.2025.103627_b129","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102802","article-title":"Transformers in medical imaging: A survey","author":"Shamshad","year":"2023","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b130","doi-asserted-by":"crossref","DOI":"10.5829\/IJE.2023.36.08B.16","article-title":"Cross-modal deep learning-based clinical recommendation system for radiology report generation from chest X-rays","author":"Shetty","year":"2023","journal-title":"Int. J. Eng."},{"key":"10.1016\/j.media.2025.103627_b131","doi-asserted-by":"crossref","first-page":"7441","DOI":"10.1007\/s00521-021-05943-6","article-title":"Show, tell and summarise: learning to generate and summarise radiology findings from medical images","volume":"33","author":"Singh","year":"2021","journal-title":"Neural Comput. Appl."},{"issue":"1","key":"10.1016\/j.media.2025.103627_b132","doi-asserted-by":"crossref","DOI":"10.1371\/journal.pone.0262209","article-title":"Attention based automated radiology report generation using CNN and LSTM","volume":"17","author":"Sirshar","year":"2022","journal-title":"Plos One"},{"key":"10.1016\/j.media.2025.103627_b133","series-title":"CheXbert: combining automatic labelers and expert annotations for accurate radiology report labeling using BERT","author":"Smit","year":"2020"},{"key":"10.1016\/j.media.2025.103627_b134","doi-asserted-by":"crossref","unstructured":"Smit, A., Jain, S., Rajpurkar, P., Pareek, A., Ng, A.Y., Lungren, M., 2020b. Combining Automatic Labelers and Expert Annotations for Accurate Radiology Report Labeling Using BERT. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing. EMNLP, pp. 1500\u20131519.","DOI":"10.18653\/v1\/2020.emnlp-main.117"},{"key":"10.1016\/j.media.2025.103627_b135","unstructured":"Song, X., Zhang, X., Ji, J., Liu, Y., Wei, P., 2022. Cross-modal Contrastive Attention Model for Medical Report Generation. In: Proceedings of the 29th International Conference on Computational Linguistics. pp. 2388\u20132397."},{"issue":"6","key":"10.1016\/j.media.2025.103627_b136","doi-asserted-by":"crossref","first-page":"1526","DOI":"10.1007\/s11263-022-01611-x","article-title":"Curriculum learning: A survey","volume":"130","author":"Soviany","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.media.2025.103627_b137","series-title":"Rotate: Knowledge graph embedding by relational rotation in complex space","author":"Sun","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b138","series-title":"Eva-clip: Improved training techniques for clip at scale","author":"Sun","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b139","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2022: 25th International Conference, Singapore, September 18\u201322, 2022, Proceedings, Part V","first-page":"615","article-title":"Lesion guided explainable few weak-shot medical report generation","author":"Sun","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b140","doi-asserted-by":"crossref","unstructured":"Tanida, T., M\u00fcller, P., Kaissis, G., Rueckert, D., 2023. Interactive and Explainable Region-guided Radiology Report Generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 7433\u20137442.","DOI":"10.1109\/CVPR52729.2023.00718"},{"key":"10.1016\/j.media.2025.103627_b141","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2022: 25th International Conference, Singapore, September 18\u201322, 2022, Proceedings, Part V","first-page":"714","article-title":"RepsNet: Combining vision with language for automated medical reports","author":"Tanwani","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b142","series-title":"Deep Medicine: How Artificial Intelligence Can Make Healthcare Human Again","author":"Topol","year":"2019"},{"key":"10.1016\/j.media.2025.103627_b143","series-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023"},{"issue":"3","key":"10.1016\/j.media.2025.103627_b144","doi-asserted-by":"crossref","DOI":"10.1056\/AIoa2300138","article-title":"Towards generalist biomedical AI","volume":"1","author":"Tu","year":"2024","journal-title":"NEJM AI"},{"key":"10.1016\/j.media.2025.103627_b145","unstructured":"Van Miltenburg, E., Elliott, D., Vossen, P., 2018. Measuring the diversity of automatic image descriptions. In: Proceedings of the 27th International Conference on Computational Linguistics. pp. 1730\u20131741."},{"key":"10.1016\/j.media.2025.103627_b146","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2025.103627_b147","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Lawrence Zitnick, C., Parikh, D., 2015. Cider: Consensus-based image description evaluation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 4566\u20134575.","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"10.1016\/j.media.2025.103627_b148","series-title":"Computer Vision\u2013ECCV 2022: 17th European Conference, Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part XXXV","first-page":"563","article-title":"Cross-modal prototype driven network for radiology report generation","author":"Wang","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b149","article-title":"CAMANet: class activation map guided attention network for radiology report generation","author":"Wang","year":"2024","journal-title":"IEEE J. Biomed. Heal. Inform."},{"issue":"10","key":"10.1016\/j.media.2025.103627_b150","doi-asserted-by":"crossref","first-page":"2803","DOI":"10.1109\/TMI.2022.3171661","article-title":"Automated radiographic report generation purely on transformer: A multicriteria supervised approach","volume":"41","author":"Wang","year":"2022","journal-title":"IEEE Trans. Med. Imaging"},{"key":"10.1016\/j.media.2025.103627_b151","article-title":"Trust it or not: Confidence-guided automatic radiology report generation","author":"Wang","year":"2024","journal-title":"Neurocomputing"},{"key":"10.1016\/j.media.2025.103627_b152","doi-asserted-by":"crossref","unstructured":"Wang, Z., Liu, L., Wang, L., Zhou, L., 2023a. METransformer: Radiology Report Generation by Transformer with Multiple Learnable Expert Tokens. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 11558\u201311567.","DOI":"10.1109\/CVPR52729.2023.01112"},{"issue":"3","key":"10.1016\/j.media.2025.103627_b153","doi-asserted-by":"crossref","DOI":"10.1016\/j.metrad.2023.100033","article-title":"R2gengpt: Radiology report generation with frozen llms","volume":"1","author":"Wang","year":"2023","journal-title":"Meta-Radiol."},{"key":"10.1016\/j.media.2025.103627_b154","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2022: 25th International Conference, Singapore, September 18\u201322, 2022, Proceedings, Part VIII","first-page":"568","article-title":"An inclusive task-aware framework for radiology report generation","author":"Wang","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b155","doi-asserted-by":"crossref","unstructured":"Wang, S., Peng, B., Liu, Y., Peng, Q., 2023c. Fine-grained medical vision-language representation learning for radiology report generation. In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. pp. 15949\u201315956.","DOI":"10.18653\/v1\/2023.emnlp-main.989"},{"key":"10.1016\/j.media.2025.103627_b156","first-page":"486","article-title":"Prior knowledge enhances radiology report generation","volume":"vol. 2022","author":"Wang","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b157","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2022: 25th International Conference, Singapore, September 18\u201322, 2022, Proceedings, Part III","first-page":"655","article-title":"A medical semantic-assisted transformer for radiographic report generation","author":"Wang","year":"2022"},{"key":"10.1016\/j.media.2025.103627_b158","series-title":"2023 IEEE International Conference on Image Processing","first-page":"2275","article-title":"Self adaptive global-local feature enhancement for radiology report generation","author":"Wang","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b159","series-title":"Chatcad: Interactive computer-aided diagnosis on medical image using large language models","author":"Wang","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b160","doi-asserted-by":"crossref","unstructured":"Wang, Z., Zhou, L., Wang, L., Li, X., 2021. A self-boosting framework for automated radiographic report generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 2433\u20132442.","DOI":"10.1109\/CVPR46437.2021.00246"},{"key":"10.1016\/j.media.2025.103627_b161","doi-asserted-by":"crossref","first-page":"229","DOI":"10.1023\/A:1022672621406","article-title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","volume":"8","author":"Williams","year":"1992","journal-title":"Mach. Learn."},{"key":"10.1016\/j.media.2025.103627_b162","article-title":"Chest imagenome dataset","author":"Wu","year":"2021","journal-title":"Phys. Net"},{"key":"10.1016\/j.media.2025.103627_b163","series-title":"Conference on Health, Inference, and Learning","first-page":"72","article-title":"Token imbalance adaptation for radiology report generation","author":"Wu","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b164","first-page":"1","article-title":"Multimodal contrastive learning for radiology report generation","author":"Wu","year":"2022","journal-title":"J. Ambient. Intell. Humaniz. Comput."},{"key":"10.1016\/j.media.2025.103627_b165","first-page":"1305","article-title":"AI accelerated human-in-the-loop structuring of radiology reports","volume":"vol. 2020","author":"Wu","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b166","series-title":"Towards generalist foundation model for radiology by leveraging web-scale 2D&3D medical data","author":"Wu","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b167","doi-asserted-by":"crossref","unstructured":"Xu, C., Hu, B., Jiang, Y., Feng, K., Wang, Z., Huang, S., Ju, Q., Xiao, T., Zhu, J., 2020. Dynamic Curriculum Learning for Low-Resource Neural Machine Translation. In: Proceedings of the 28th International Conference on Computational Linguistics. pp. 3977\u20133989.","DOI":"10.18653\/v1\/2020.coling-main.352"},{"key":"10.1016\/j.media.2025.103627_b168","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2023.101817","article-title":"Vision-knowledge fusion model for multi-domain medical report generation","volume":"97","author":"Xu","year":"2023","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.media.2025.103627_b169","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.121260","article-title":"Generating radiology reports via auxiliary signal guidance and a memory-driven network","volume":"237","author":"Xue","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.media.2025.103627_b170","doi-asserted-by":"crossref","unstructured":"Yan, S., 2022. Memory-aligned knowledge graph for clinically accurate radiology image report generation. In: Proceedings of the 21st Workshop on Biomedical Language Processing. pp. 116\u2013122.","DOI":"10.18653\/v1\/2022.bionlp-1.11"},{"issue":"11","key":"10.1016\/j.media.2025.103627_b171","doi-asserted-by":"crossref","first-page":"5631","DOI":"10.1109\/JBHI.2022.3197162","article-title":"Prior guided transformer for accurate radiology reports generation","volume":"26","author":"Yan","year":"2022","journal-title":"IEEE J. Biomed. Heal. Inform."},{"key":"10.1016\/j.media.2025.103627_b172","series-title":"Multimodal chatgpt for medical applications: an experimental study of gpt-4v","author":"Yan","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b173","doi-asserted-by":"crossref","first-page":"40","DOI":"10.1016\/j.neucom.2020.09.084","article-title":"Automatic ultrasound image report generation with adaptive multimodal attention mechanism","volume":"427","author":"Yang","year":"2021","journal-title":"Neurocomputing"},{"key":"10.1016\/j.media.2025.103627_b174","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102798","article-title":"Radiology report generation with a learned knowledge base and multi-modal alignment","volume":"86","author":"Yang","year":"2023","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b175","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2022.102510","article-title":"Knowledge matters: Chest radiology report generation with general and specific knowledge","volume":"80","author":"Yang","year":"2022","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b176","article-title":"Joint embedding of deep visual and semantic features for medical image report generation","author":"Yang","year":"2021","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.media.2025.103627_b177","unstructured":"You, J., Li, D., Okumura, M., Suzuki, K., 2022. JPG-Jointly Learn to Align: Automated Disease Prediction and Radiology Report Generation. In: Proceedings of the 29th International Conference on Computational Linguistics. pp. 5989\u20136001."},{"key":"10.1016\/j.media.2025.103627_b178","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part III 24","first-page":"72","article-title":"Aligntransformer: Hierarchical alignment of visual regions and disease tags for medical report generation","author":"You","year":"2021"},{"key":"10.1016\/j.media.2025.103627_b179","article-title":"Semi-supervised medical report generation via graph-guided hybrid feature consistency","author":"Zhang","year":"2023","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.media.2025.103627_b180","unstructured":"Zhang, T., Kishore, V., Wu, F., Weinberger, K.Q., Artzi, Y., 2019. BERTScore: Evaluating Text Generation with BERT. In: International Conference on Learning Representations."},{"key":"10.1016\/j.media.2025.103627_b181","doi-asserted-by":"crossref","DOI":"10.1016\/j.compeleceng.2021.107673","article-title":"Category supervised cross-modal hashing retrieval for chest X-ray and radiology reports","volume":"98","author":"Zhang","year":"2022","journal-title":"Comput. Electr. Eng."},{"key":"10.1016\/j.media.2025.103627_b182","article-title":"A novel deep learning model for medical report generation by inter-intra information calibration","author":"Zhang","year":"2023","journal-title":"IEEE J. Biomed. Heal. Inform."},{"key":"10.1016\/j.media.2025.103627_b183","first-page":"12910","article-title":"When radiology report generation meets knowledge graph","volume":"vol. 34","author":"Zhang","year":"2020"},{"key":"10.1016\/j.media.2025.103627_b184","series-title":"Large-scale domain-specific pretraining for biomedical vision-language processing","first-page":"6","author":"Zhang","year":"2023"},{"key":"10.1016\/j.media.2025.103627_b185","first-page":"1","article-title":"A generalist vision\u2013language foundation model for diverse biomedical tasks","author":"Zhang","year":"2024","journal-title":"Nature Med."},{"key":"10.1016\/j.media.2025.103627_b186","series-title":"ReXrank: A public leaderboard for AI-powered radiology report generation","author":"Zhang","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b187","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102906","article-title":"Attractive deep morphology-aware active contour network for vertebral body contour extraction with extensions to heterogeneous and semi-supervised scenarios","volume":"89","author":"Zhao","year":"2023","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2025.103627_b188","series-title":"A generalist learner for multifaceted medical image interpretation","author":"Zhou","year":"2024"},{"key":"10.1016\/j.media.2025.103627_b189","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Huang, L., Zhou, T., Fu, H., Shao, L., 2021. Visual-textual attentive semantic consistency for medical report generation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 3985\u20133994.","DOI":"10.1109\/ICCV48922.2021.00395"},{"key":"10.1016\/j.media.2025.103627_b190","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A., 2016. Learning deep features for discriminative localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 2921\u20132929.","DOI":"10.1109\/CVPR.2016.319"},{"key":"10.1016\/j.media.2025.103627_b191","doi-asserted-by":"crossref","unstructured":"Zhu, J.Y., Park, T., Isola, P., Efros, A.A., 2017. Unpaired image-to-image translation using cycle-consistent adversarial networks. In: Proceedings of the IEEE International Conference on Computer Vision. pp. 2223\u20132232.","DOI":"10.1109\/ICCV.2017.244"}],"container-title":["Medical Image Analysis"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841525001744?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841525001744?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,3,26]],"date-time":"2026-03-26T13:13:17Z","timestamp":1774530797000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1361841525001744"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7]]},"references-count":191,"alternative-id":["S1361841525001744"],"URL":"https:\/\/doi.org\/10.1016\/j.media.2025.103627","relation":{},"ISSN":["1361-8415"],"issn-type":[{"value":"1361-8415","type":"print"}],"subject":[],"published":{"date-parts":[[2025,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"A survey of deep-learning-based radiology report generation using multimodal inputs","name":"articletitle","label":"Article Title"},{"value":"Medical Image Analysis","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.media.2025.103627","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2025 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"103627"}}