diff --git a/.jules/bolt.md b/.jules/bolt.md new file mode 100644 index 0000000..17c8f29 --- /dev/null +++ b/.jules/bolt.md @@ -0,0 +1,3 @@ +## 2025-03-01 - [Bolt: Fix Clinical Context Lexicon Generation Time] +**Learning:** The openmed project's `openmed.clinical.context` relies heavily on `_compiled_context_lexicon` which recursively compiles and computes large numbers of regexs. Because this wasn't cached, it added up linearly during multiple queries or requests (i.e. spans/modifiers evaluations in text). +**Action:** Use `functools.lru_cache` to cache deterministic regex compilations and lexicon generation in text/NLP pipelines. diff --git a/openmed/openmed/clinical/context.py b/openmed/openmed/clinical/context.py index 9fd11df..eccdc60 100644 --- a/openmed/openmed/clinical/context.py +++ b/openmed/openmed/clinical/context.py @@ -35,6 +35,7 @@ from __future__ import annotations +import functools import re from collections.abc import Iterable, Iterator, Mapping, Sequence from dataclasses import dataclass, replace @@ -154,6 +155,8 @@ class _CompiledContextLexicon: backward_context_cues: frozenset[str] +# Memoize lexicon compilation to prevent repeated regex generation and improve performance +@functools.lru_cache def _compiled_context_lexicon(language: str | None = None) -> _CompiledContextLexicon: lexicon = get_clinical_cue_lexicon(language) token_boundaries = lexicon.token_boundaries