Commit a5a2dcdd authored by seyonechithrananda's avatar seyonechithrananda
Browse files

docstring for regex pattern

parent 84d17586
Loading
Loading
Loading
Loading
+5 −4
Original line number Diff line number Diff line
@@ -14,13 +14,10 @@ from transformers import BertTokenizer



SMI_REGEX_PATTERN = r"""(\[[^\]]+]|Br?|Cl?|N|O|S|P|F|I|b|c|n|o|s|p|\(|\)|\.|=|
#|-|\+|\\|\/|:|~|@|\?|>>?|\*|\$|\%[0-9]{2}|[0-9])"""

"""
SMI_REGEX_PATTERN: str
    SMILES regex pattern for tokenization. Designed by Schwaller et. al. 


References

.. [1]  Philippe Schwaller, Teodoro Laino, Théophile Gaudin, Peter Bolgar, Christopher A. Hunter, Costas Bekas, and Alpha A. Lee
@@ -29,6 +26,10 @@ References

"""

SMI_REGEX_PATTERN = r"""(\[[^\]]+]|Br?|Cl?|N|O|S|P|F|I|b|c|n|o|s|p|\(|\)|\.|=|
#|-|\+|\\|\/|:|~|@|\?|>>?|\*|\$|\%[0-9]{2}|[0-9])"""


def get_default_tokenizer():
    default_vocab_path = (
        pkg_resources.resource_filename(