Ë
    ÝÍ:j=5 ã            	      ó8  — d dl mZ d dlZd dlZd dlZd dlZd dlZd dlZd dl	m
Z d dlZd dlZd dlmZmZmZmZ d dlmZmZmZmZ ddlmZ ddlmZmZ ddlmZ dd	l m!Z!m"Z"  ejF                  d
ejH                  ¬«        ejJ                  e&«      Z' G d„ d«      Z( G d„ de(«      Z) G d„ de(«      Z* G d„ de(«      Z+ G d„ de(«      Z, G d„ de(«      Z- G d„ de(«      Z.d„ Z/ G d„ d«      Z0dBd„Z1dCd„Z2	 	 	 	 	 	 	 	 	 	 	 	 	 	 dDd„Z3d „ Z4 G d!„ d"«      Z5 G d#„ d$«      Z6 G d%„ d&«      Z7d'„ Z8d(„ Z9d)„ Z:e&d*k(  �rç e:«       Z;e;jx                  re'j{                  ej|                  «       e;j~                  Z@e;j‚                  ZBe!e;j†                     ZCe;jˆ                  r eEe;jˆ                  «      nd+ZDe;jŒ                  r eEe;jŒ                  «      ndZFejŽ                  j‘                  eB«      r!e'j“                  d,eB› d-�«        eJd,eB› d-�«      ‚e;j–                  r'e;j˜                  d.k(  re'j›                  d/«       d0e;_K         ejœ                  e@«      ZOe;j˜                  d.k(  r" e,e;j                   e;j¢                  eDeF¬1«      ZR�n=e;j˜                  d2k(  r8 e-e;j                   e;j–                  e;j¦                  eCeDeFe;j¢                  ¬3«      ZRnöe;j˜                  d4k(  r
 e)eD¬5«      ZRnÝe;j˜                  d6k(  r
 e*eD¬5«      ZRnÄe;j˜                  d7k(  r e+e;j                   eD¬8«      ZRn e;j˜                  d9k(  r|eCe!j¨                  k(  re'j›                  d:«       e!jª                  ZCe@ZOe;j¬                  �e;j¬                  d;k(  rd<ZVnd=ZVnd<ZV e.e;j®                  e;j°                  e;j²                  eV¬>«      ZRn eZd?e;j˜                  › �«      ‚ e7eOe;j¢                  e;j¦                  e;j¶                  e;j¸                  eR¬@«      Z]e]j½                  «        e]jž                  j¿                  eBdA«       yy)Eé    )ÚannotationsN)Ú
GraphProtoÚ
ModelProtoÚ	NodeProtoÚTensorProto)Úquantize_matmul_2bitsÚquantize_matmul_4bitsÚquantize_matmul_8bitsÚquantize_qdq_matmul_4bitsé   )ÚCalibrationDataReader)Úgptq_quantizeÚrtn_quantize)Ú	ONNXModel)ÚQuantFormatÚattribute_to_kwargz2%(asctime)s %(name)s [%(levelname)s] - %(message)s)ÚformatÚlevelc                  ó.   — e Zd Z	 	 	 d	 	 	 	 	 	 	 	 	 dd„Zy)ÚWeightOnlyQuantConfigNc                ó†   — || _         || _        |rt        |«      ndh| _        |rt	        |«      ndddœ| _        || _        y)aq  This is the Base class for Weight Only blockwise quantization Configuration.

        Args:
            algorithm:
                weight only quantize algorithm name.
            quant_format: QuantFormat{QOperator, QDQ}.
                QOperator format quantizes the model with quantized operators directly.
                QDQ format quantize the model by inserting QuantizeLinear/DeQuantizeLinear on the tensor.
            op_types_to_quantize (optional):
                set of operator types to quantize. Default {MatMul}
            quant_axes (dict[str, int], optional):
                op:axis, which axis to quantize for an op. Default {MatMul: 0, Gather: 1}
            customized_weight_config:
                customized weight config for nodes if needed. It is dictionary with node name as key,
                and the value is a dict of customized config.
        ÚMatMulr   r   )r   ÚGatherN)Ú	algorithmÚquant_formatÚsetÚop_types_to_quantizeÚdictÚ
quant_axesÚcustomized_weight_config)Úselfr   r   r   r   r    s         ú„/home/mcse/projects/srt_converter/srt-converter-venv/lib/python3.12/site-packages/onnxruntime/quantization/matmul_nbits_quantizer.pyÚ__init__zWeightOnlyQuantConfig.__init__&   sG   € ð0 #ˆŒØ(ˆÔÙAU¤CÐ(<Ô$=Ð\dÐ[eˆÔ!Ù.8œ$˜zÔ*ÈÐVWÑ>XˆŒØ(@ˆÕ%ó    )NNN)
r   Ústrr   r   r   útuple[str, ...] | Noner   ú"tuple[tuple[str, int], ...] | Noner    údict | None)Ú__name__Ú
__module__Ú__qualname__r#   © r$   r"   r   r   %   sH   „ ð
 8<Ø9=Ø04ðAàðAð "ðAð 5ð	Að
 7ðAð #.ôAr$   r   c                  óD   ‡ — e Zd Zdej                  ddf	 	 	 dˆ fd„Zˆ xZS )ÚRTNWeightOnlyQuantConfigNc                óv   •— |t         j                  k(  sJ d«       ‚|€i }t        ‰| �  d|||¬«       || _        y)ap  
        This is a class for round-to-nearest (RTN) algorithm Weight Only Quant Configuration.
        RTN is the most straightforward way to quantize weight using scale maps.

        Args:
            ratios:
                percentile of clip. Defaults to {}.
            quant_format (QuantFormat{QOperator, QDQ}, optional):
                QOperator format quantizes the model with quantized operators directly.
                QDQ format quantize the model by inserting QuantizeLinear/DeQuantizeLinear on the tensor.
                Defaults to QuantFormat.QOperator.
            op_types_to_quantize (optional):
                set of operator types to quantize.
            customized_weight_config:
                customized weight config for nodes if needed. It is dictionary with node name as key,
                and the value is a dict of customized config.
        z"RTN only supports QOperator formatNÚRTN©r   r   r   r    ©r   Ú	QOperatorÚsuperr#   Úratios©r!   r5   r   r   r    Ú	__class__s        €r"   r#   z!RTNWeightOnlyQuantConfig.__init__F   sP   ø€ ð0 œ{×4Ñ4Ò4ÐZÐ6ZÓZÐ4àˆ>ØˆFÜ‰ÑØØ%Ø!5Ø%=ð	 	ô 	
ð ˆ�r$   ©r   r&   r    r(   ©r)   r*   r+   r   r3   r#   Ú__classcell__©r7   s   @r"   r.   r.   E   s5   ø„ ð Ø ×*Ñ*Ø7;Ø04ð"ð 5ð	"ð
 #.÷"ñ "r$   r.   c                  óD   ‡ — e Zd Zdej                  ddf	 	 	 dˆ fd„Zˆ xZS )ÚKQuantWeightOnlyQuantConfigNc                óv   •— |t         j                  k(  sJ d«       ‚|€i }t        ‰| �  d|||¬«       || _        y)aF  
        This is a class for k-quant algorithm Weight Only Quant Configuration.

        Args:
            ratios:
                percentile of clip. Defaults to {}.
            quant_format (QuantFormat{QOperator, QDQ}, optional):
                QOperator format quantizes the model with quantized operators directly.
                QDQ format quantize the model by inserting QuantizeLinear/DeQuantizeLinear on the tensor.
                Defaults to QuantFormat.QOperator.
            op_types_to_quantize (optional):
                set of operator types to quantize.
        z&k-quant only supports QOperator formatNÚk_quantr1   r2   r6   s        €r"   r#   z$KQuantWeightOnlyQuantConfig.__init__l   sP   ø€ ð( œ{×4Ñ4Ò4Ð^Ð6^Ó^Ð4àˆ>ØˆFÜ‰ÑØØ%Ø!5Ø%=ð	 	ô 	
ð ˆ�r$   r8   r9   r;   s   @r"   r=   r=   k   s5   ø„ ð Ø ×*Ñ*Ø7;Ø04ðð 5ð	ð
 #.÷ñ r$   r=   c                  óL   ‡ — e Zd Zddddddej                  df	 	 	 dˆ fd„Zˆ xZS )ÚGPTQWeightOnlyQuantConfigNg{®Gáz„?é€   FTc	                ó²   •— |t         j                  k(  sJ d«       ‚t        ‰	| �  d||¬«       || _        || _        || _        || _        || _        || _	        y)a  
        This is a class for GPTQ algorithm Weight Only Quant Configuration.
        GPTQ algorithm provides more accurate quantization but requires more computational resources.

        Args:
            calibration_data_reader:
                a calibration data reader. It enumerates calibration data and generates inputs for the original model.
            percdamp:
                percent of the average Hessian diagonal to use for dampening.
            block_size (int, optional):
                channel number in one block to execute a GPTQ quantization iteration.
            actorder (bool, optional):
                whether rearrange Hessian matrix considering the diag's value.
            mse (bool, optional):
                whether get scale and zero point with mse error.
            perchannel (bool, optional):
                whether quantize weight per-channel.
            quant_format (QuantFormat{QOperator, QDQ}, optional):
                QOperator format quantizes the model with quantized operators directly.
                QDQ format quantize the model by inserting QuantizeLinear/DeQuantizeLinear on the tensor.
                Defaults to QuantFormat.QOperator.
            op_types_to_quantize (optional):
                set of operator types to quantize.
        z#GPTQ only supports QOperator formatÚGPTQ)r   r   r   N)
r   r3   r4   r#   Úcalibration_data_readerÚpercdampÚ
block_sizeÚactorderÚmseÚ
perchannel)
r!   rE   rF   rG   rH   rI   rJ   r   r   r7   s
            €r"   r#   z"GPTQWeightOnlyQuantConfig.__init__Ž   sh   ø€ ðF œ{×4Ñ4Ò4Ð[Ð6[Ó[Ð4ä‰ÑØØ%Ø!5ð 	ô 	
ð
 (?ˆÔ$Ø ˆŒØ$ˆŒØ ˆŒØˆŒØ$ˆ�r$   )rE   zCalibrationDataReader | Noner   r&   r9   r;   s   @r"   rA   rA   �   sA   ø„ ð AEØØØØØØ ×*Ñ*Ø7;ð/%à!=ð/%ð 5÷/%ñ /%r$   rA   c                  óH   ‡ — e Zd Zdddej                  ddf	 	 	 dˆ fd„Zˆ xZS )ÚHQQWeightOnlyQuantConfigrB   é   r   Nc                óŠ   •— |t         j                  k(  sJ d«       ‚t        ‰| �  d|||¬«       || _        || _        || _        y)a  
        This is a class for HQQ algorithm Weight Only Quant Configuration.
        HQQ algorithm quant weight without needing calibrate data.

        Args:
            block_size (int, optional):
                channel number in one block to execute a HQQ quantization iteration.
            bits (int, optional):
                how many bits to represent weight.
            axis (int, optional):
                0 or 1. which axis to quantize. https://arxiv.org/pdf/2309.15531.pdf
            quant_format (QuantFormat{QOperator, QDQ}, optional):
                QOperator format quantizes the model with quantized operators directly.
                QDQ format quantize the model by inserting QuantizeLinear/DeQuantizeLinear on the tensor.
                Defaults to QuantFormat.QOperator.
            op_types_to_quantize (optional):
                set of operator types to quantize.
            quant_axes (dict[str, int], optional):
                op:axis, which axis to quantize for an op. Default {MatMul: 0, Gather: 1}
        z"HQQ only supports QOperator formatÚHQQ©r   r   r   r   N)r   r3   r4   r#   rG   ÚbitsÚaxis)r!   rG   rQ   rR   r   r   r   r7   s          €r"   r#   z!HQQWeightOnlyQuantConfig.__init__Á   sT   ø€ ð: œ{×4Ñ4Ò4ÐZÐ6ZÓZÐ4ä‰ÑØØ%Ø!5Ø!ð	 	ô 	
ð %ˆŒØˆŒ	Øˆ�	r$   )r   r&   r   r'   r9   r;   s   @r"   rL   rL   À   s;   ø„ ð ØØØ ×*Ñ*Ø7;Ø9=ð'ð 5ð'ð 7÷'ñ 'r$   rL   c                  ó`   ‡ — e Zd Zdddej                  ddddf	 	 	 	 	 	 	 	 	 	 	 	 	 dˆ fd„Zˆ xZS )ÚDefaultWeightOnlyQuantConfigrB   FNrM   c	                ó´   •— t         ‰	| �  d|||¬«       || _        || _        || _        || _        || _        |r|t        j                  k(  rt        d«      ‚yy)a   
        This is a class for weight only affine quantization configuration.

        Args:
            block_size (int, optional):
                channel number in one block to execute an affine quantization iteration.
            is_symmetric (bool, optional):
                whether quantize weight symmetrically.
            accuracy_level (int, optional):
                Accuracy level of the 4-bit quantized MatMul computation.
                Refer to the MatMulNBits contrib op's 'accuracy_level' attribute for details.
                (https://github.com/microsoft/onnxruntime/blob/main/docs/ContribOperators.md#commicrosoftmatmulnbits)
            quant_format (QuantFormat{QOperator, QDQ}, optional):
                QOperator format quantizes the model with quantized operators directly.
                QDQ format quantize the model by inserting QuantizeLinear/DeQuantizeLinear on the tensor.
                Defaults to QuantFormat.QOperator.
            op_types_to_quantize (optional):
                set of operator types to quantize.
            quant_axes (dict[str, int], optional):
                op:axis, which axis to quantize for an op. Default {MatMul: 0, Gather: 1}
            bits (int, optional):
                number of bits per element after quantization. Default 4.
        ÚDEFAULTrP   zAQuantFormat.QOperator is not supported channel_wised_quantize yetN)
r4   r#   rG   Úis_symmetricrQ   Úaccuracy_levelÚchannel_wised_quantizer   r3   ÚNotImplementedError)
r!   rG   rW   rX   r   r   r   rQ   rY   r7   s
            €r"   r#   z%DefaultWeightOnlyQuantConfig.__init__ì   sq   ø€ ôD 	‰ÑØØ%Ø!5Ø!ð	 	ô 	
ð %ˆŒØ(ˆÔØˆŒ	Ø,ˆÔØ&<ˆÔ#Ù! l´k×6KÑ6KÒ&KÜ%Ð&iÓjÐjð 'LÐ!r$   )rG   ÚintrW   ÚboolrX   ú
int | Noner   r&   r   r'   rQ   r[   rY   r\   r9   r;   s   @r"   rT   rT   ë   sz   ø„ ð Ø"Ø%)Ø ×*Ñ*Ø7;Ø9=ØØ',ð.kàð.kð ð.kð #ð	.kð 5ð.kð 7ð.kð ð.kð !%÷.kñ .kr$   rT   c                  ó2   ‡ — e Zd Z	 	 	 dˆ fd„	Zd„ Zd„ Zˆ xZS )ÚNVAWQWeightOnlyQuantConfigc                ót  •— 	 ddl }ddlm} || _         || _        	 ddlm} || _        	 dd	lm}m	}	 || _        |	| _	        t        ‰| �-  dt        j                  dd¬«       | j                   j                  | j                   j                  j!                  «       rdnd«      }
| j#                  |||ddd|
ddddd¬«      }|| _        || _        y# t        $ r t	        d«       t        d«      d‚w xY w# t        $ r t	        d«       t        d«      d‚w xY w# t        $ r t	        d
«       t        d«      d‚w xY w)a=  
        Configuration for the nvidia_awq quantization method.

        Args:
            tokenizer_dir (str): pathof the tokenizer dir.
            dataset_name (str): Name of the dataset.
            cache_dir (str): Directory for caching.
            calibration_method (str): calib method for nvidia_awq.
        r   N)Ú
DataLoaderzfError: The 'torch' library is required but not installed. Please install it using 'pip install torch'.z torch is not installed. Exiting.)Úload_datasetzlError: The 'datasets' library is required but not installed. Please install it using 'pip install datasets'.z#datasets is not installed. Exiting.)Ú
AutoConfigÚAutoTokenizerztError: The 'transformers' library is required but not installed. Please install it using 'pip install transformers'.z'transformers is not installed. Exiting.Ú
nvidia_awqrP   ÚcudaÚcpué    r   i   TFrB   )Údataset_nameÚ
model_nameÚ	cache_dirÚ
calib_sizeÚ
batch_sizerG   ÚdeviceÚuse_fp16Úuse_buffer_shareÚadd_past_kv_inputsÚmax_calib_rows_to_loadÚadd_position_ids)ÚtorchÚtorch.utils.datara   ÚImportErrorÚprintÚdatasetsrb   Útransformersrc   rd   r4   r#   r   ÚQDQrn   rf   Úis_availableÚget_calib_inputsrE   Úcalibration_method)r!   Útokenizer_dirri   rk   r}   rt   ra   rb   rc   rd   rn   Úcalib_inputsr7   s               €r"   r#   z#NVAWQWeightOnlyQuantConfig.__init__  sm  ø€ ð"
	LÛÝ3àˆDŒJØ(ˆDŒOð	OÝ-à ,ˆDÔð		Sß>à(ˆDŒOØ!.ˆDÔô 	‰ÑØ"Ü$Ÿ™Ø!%Øð	 	ô 	
ð —‘×"Ñ"¨T¯Z©Z¯_©_×-IÑ-IÔ-K¡6ÐQVÓWˆà×,Ñ,Ø%Ø$ØØØØØØØ"Ø#Ø#&Ø!ð -ó 
ˆð (4ˆÔ$Ø"4ˆÕøôo ò 	LÜØxôô Ð@ÓAÀtÐKð		Lûô ò 	OÜØ~ôô ÐCÓDÈ$ÐNð		Oûô ò 	SÜð Gôô ÐGÓHÈdÐRð		Sús!   ƒC œC2 ªD Ã!C/Ã2!DÄ!D7c	           	     ób  — | j                   }	|}
|}t        |t        «      r<|	j                  |||	j                  ¬«      }
|	j                  |||	j                  ¬«      }|
j                  «       |j                  «       dœ}|rJ|j                  «       j                  d«      dz
  }|j                  |dk(  d«       |j                  «       |d<   |rã|r|	j                  n|	j                  }|
j                  \  }}|j                  }|j                  |j                  |j                  z  }}t!        |j"                  «      D ]q  }|	j%                  |||r|nd|||¬«      }|	j%                  |||r|nd|||¬«      }|j'                  d|› d�|j                  «       d|› d	�|j                  «       i«       Œs |S )
N)rn   Údtype)Ú	input_idsÚattention_maskéÿÿÿÿr   r   Úposition_idszpast_key_values.z.keyz.value)rt   Ú
isinstanceÚlistÚtensorÚint64Ú
contiguousÚlongÚcumsumÚmasked_fill_Úfloat16Úfloat32ÚshapeÚmax_position_embeddingsÚnum_key_value_headsÚhidden_sizeÚnum_attention_headsÚrangeÚnum_hidden_layersÚzerosÚupdate)r!   ÚconfigÚinput_ids_argÚattention_mask_argrq   rn   ro   rp   rs   rt   r‚   rƒ   Úinputsr…   Útorch_dtyperm   Úsequence_lengthÚmax_sequence_lengthÚ	num_headsÚ	head_sizeÚiÚpast_keyÚ
past_values                          r"   Úmake_model_inputz+NVAWQWeightOnlyQuantConfig.make_model_inputn  sÍ  € ð —
‘
ˆà!ˆ	Ø+ˆä�m¤TÔ*ØŸ™ ]¸6ÈÏÉ˜ÓUˆIØ"Ÿ\™\Ð*<ÀVÐSX×S^ÑS^˜\Ó_ˆNð #×-Ñ-Ó/Ø,×7Ñ7Ó9ñ
ˆñ
 Ø)×.Ñ.Ó0×7Ñ7¸Ó;¸aÑ?ˆLØ×%Ñ% n¸Ñ&9¸1Ô=Ø%1×%<Ñ%<Ó%>ˆF�>Ñ"áÙ+3˜%Ÿ-š-¸¿¹ˆKØ*3¯/©/Ñ'ˆJ˜Ø"(×"@Ñ"@Ðà×*Ñ*Ø×"Ñ" f×&@Ñ&@Ñ@ð !ˆIô ˜6×3Ñ3Ó4ò �Ø Ÿ;™;ØØÙ+;Ñ'ÀØØ!Ø%ð 'ó �ð #Ÿ[™[ØØÙ+;Ñ'ÀØØ!Ø%ð )ó �
ð —‘à*¨1¨#¨TÐ2°H×4GÑ4GÓ4IØ*¨1¨#¨VÐ4°j×6KÑ6KÓ6Mðõð#ð0 ˆr$   c                ó4  — | j                   }| j                  }| j                  }|j                  |d|d¬«      }|j                  |d|d¬«      }|j	                  ddi«       |j
                  |_        ||k  sJ d«       ‚d|v r& |ddd	¬
«      j                  t        |«      «      }d}n d|v r |dd¬«      }d}nt        d|› d�«      ‚||   d | }|j                  |ddd|¬«      }|j                  |«      }|d   }|d   }| j                  } |||d¬«      } |||d¬«      }t        |j                  «      t        |j                  «      k(  sJ ‚t        |«      t        |«      k(  sJ ‚||z  }g }t        |«      D ]   \  }}|j!                  |«       ||dz
  k(  sŒ  n g }t        |«      D ]   \  }}|j!                  |«       ||dz
  k(  sŒ  n t#        d|› dt        |«      › dt        |«      › d�«       g }t        |«      D ]t  } ||    }!||    }"| j%                  ||!|"|
|||	|«      }#|#j'                  «       D �$�%ci c]$  \  }$}%|$|%j)                  «       j+                  «       “Œ& }#}$}%|j!                  |#«       Œv t#        dt        |«      › d�«       |S c c}%}$w )NT)Úuse_auth_tokenrk   Útrust_remote_codeÚ	pad_tokenz[PAD]z8calib size should be no more than max_calib_rows_to_loadÚcnnÚcnn_dailymailz3.0.0Útrain)ÚnameÚsplitÚarticleÚpilezmit-han-lab/pile-val-backupÚ
validation)r®   Útextz	dataset "z" not supportedÚpt)Úreturn_tensorsÚpaddingÚ
truncationÚ
max_lengthr‚   rƒ   F)rm   Úshuffler   z/
--Quantize-Script-- number_of_batched_samples=z, batch-input-ids-list-len=z, batched_attention_mask=ú
z0
--Quantize-Script-- number of batched inputs = )rc   rd   rb   Úfrom_pretrainedÚadd_special_tokensÚ	eos_tokenr©   Úselectr•   Ú
ValueErrorÚbatch_encode_plusÚtora   ÚlenÚdatasetÚ	enumerateÚappendrw   r¥   Úitemsrg   Únumpy)&r!   ri   rj   rk   rl   rm   rG   rn   ro   rp   rq   rr   rs   Úauto_configÚauto_tokenizerrb   r™   Ú	tokenizerÚdataset2ÚcolumnÚbatch_encodedÚbatch_encoded_input_idsÚbatch_encoded_attention_maskÚdata_loaderÚcalib_dataloader_input_idsÚcalib_dataloader_attention_maskÚnumber_of_batched_samplesÚbatched_input_idsÚidxÚdataÚbatched_attention_maskÚbatched_inputs_listr¢   r‚   rƒ   rœ   Ú
input_nameÚtorch_tensors&                                         r"   r|   z+NVAWQWeightOnlyQuantConfig.get_calib_inputs¯  sS  € ð  —o‘oˆØ×+Ñ+ˆØ×(Ñ(ˆà×,Ñ,Ø t°yÐTXð -ó 
ˆð #×2Ñ2Ø t°yÐTXð 3ó 
ˆ	ð 	×$Ñ$ k°7Ð%;Ô<Ø'×1Ñ1ˆ	ÔàÐ3Ò3ÐoÐ5oÓoÐ3à�LÑ Ù# O¸'ÈÔQ×XÑXÔY^Ð_uÓYvÓwˆHØ‰FØ�|Ñ#Ù#Ð$AÈÔVˆHØ‰Fä˜y¨¨°oÐFÓGÐGà˜FÑ# K ZÐ0ˆØ!×3Ñ3Ø T°4ÀDÐU_ð 4ó 
ˆð &×(Ñ(¨Ó0ˆØ"/°Ñ"<ÐØ'4Ð5EÑ'FÐ$ð —o‘oˆá%0Ð1HÐU_ÐinÔ%oÐ"Ù*5Ø(°ZÈô+
Ð'ô Ð-×5Ñ5Ó6¼#Ð>]×>eÑ>eÓ:fÒfÐfÐfÜÐ-Ó.´#Ð6UÓ2VÒVÐVÐVà$.°*Ñ$<Ð!àÐÜ"Ð#=Ó>ò 	‰IˆC�Ø×$Ñ$ TÔ*ØÐ0°1Ñ4Ó5Ùð	ð
 "$ÐÜ"Ð#BÓCò 	‰IˆC�Ø"×)Ñ)¨$Ô/ØÐ0°1Ñ4Ó5Ùð	ô
 	Ø>Ð?XÐ>Yð Z(Ü(+Ð,=Ó(>Ð'?Ð?XÔY\Ð]sÓYtÐXuÐuwðyô	
ð
 !ÐÜÐ0Ó1ò 	/ˆAØ)¨!Ñ,ˆIØ3°AÑ6ˆNà×*Ñ*ØØØØ"ØØØ Ø ó	ˆFð ^d×]iÑ]iÓ]k×lÑAYÀÈ\�j ,×"2Ñ"2Ó"4×":Ñ":Ó"<Ñ<ÐlˆFÑlØ×&Ñ& vÕ.ð	/ô" 	ÐAÄ#ÐFYÓBZÐA[Ð[]Ð^Ô_Ø"Ð"ùó	 ms   È;)J)rª   ú./cacheÚawq_lite)r)   r*   r+   r#   r¥   r|   r:   r;   s   @r"   r_   r_     s!   ø„ ð ØØ%õN5ò`?öBa#r$   r_   c                óP   — t        |t        j                  | |z  «      z  «      | k(  S ©N)r[   ÚnpÚceil)Úval1Úval2s     r"   Úis_divisiblerâ     s$   € Üˆt”b—g‘g˜d T™kÓ*Ñ*Ó+¨tÑ3Ð3r$   c                  ó^   — e Zd Z	 	 dd„Ze	 	 	 d	 	 	 	 	 d	d„«       Zed„ «       Z	 d
d„Zdd„Zy)ÚHQQWeightOnlyQuantizerc                ó   — || _         y rÝ   ©r™   ©r!   r™   s     r"   r#   zHQQWeightOnlyQuantizer.__init__  ó   € ð ˆ�r$   Nc                ó²  ‡— dd l Š|€dddddœn|}|d   |d   |d	   |d
   f\  }}}	}
| j                  r‰j                  n‰j                  }| j	                  |«      }|j	                  |«      }|j	                  |«      }|fˆfd„	}d}t        |
«      D ]»  }‰j                  ||z  |z   «      j                  |d   |d   «      }||z
  |z  } |||z
  |«      }‰j                  |||z
  |z  z
  |d¬«      }||	z  }t        ‰j                  ||z
  «      j                  «       «      }|r t        |t        j                  |d«      «       ||k  r|}Œ» n ~~~~||fS )Nr   gffffffæ?g      $@g)\�Âõ(ð?é   )Úlp_normÚbetaÚkappaÚitersrë   rì   rí   rî   c           
     óŽ  •— |dk(  rL‰j                  | «      ‰j                  j                  j                  ‰j	                  | «      d|z  z
  «      z  S ‰j                  | «      ‰j                  j                  j                  ‰j	                  | «      d|z  ‰j                  ‰j	                  | «      dz   |dz
  «      z  z
  «      z  S )Nr   ç      ð?g:Œ0âŽyE>)ÚsignÚnnÚ
functionalÚreluÚabsÚpow)Úxrì   Úprt   s      €r"   Ú	shrink_opz:HQQWeightOnlyQuantizer.optimize_weights.<locals>.shrink_op8  s¨   ø€ Ø�AŠvØ—z‘z !“} u§x¡x×':Ñ':×'?Ñ'?ÀÇ	Á	È!ÃÈsÐUYÉzÑ@YÓ'ZÑZÐZà—z‘z !“} u§x¡x×':Ñ':×'?Ñ'?Ø—I‘I˜a“L C¨$¡J°%·)±)¸E¿I¹IÀa»LÈ4Ñ<OÐQRÐUVÑQVÓ2WÑ#WÑWó(ñ ð r$   g     ˆÃ@r   T©rR   Úkeepdimé   )rt   Úis_cudarŽ   r�   rÀ   r•   ÚroundÚclampÚmeanÚfloatrõ   rw   rÞ   )rˆ   ÚscaleÚzeroÚmin_maxrR   Ú
opt_paramsÚverboserë   rì   rí   rî   r�   Úw_frù   Ú
best_errorr¢   Úw_qÚw_rÚw_eÚcurrent_errorrt   s                       @r"   Úoptimize_weightsz'HQQWeightOnlyQuantizer.optimize_weights  s�  ø€ ó 	àR\ÐRd ¨c¸DÈ2ÒNÐjtˆ
à�yÑ!Ø�vÑØ�wÑØ�wÑð	'
Ñ#ˆ��u˜eð "(§¢�—’°U·]±]ˆØ�i‰i˜ÓˆØ—‘˜“ˆØ�w‰w�u‹~ˆà!(õ 	ð ˆ
Ü�u“ò 	ˆAØ—+‘+˜c E™k¨DÑ0Ó1×7Ñ7¸À¹
ÀGÈAÁJÓOˆCØ˜‘: Ñ&ˆCÙ˜C #™I tÓ,ˆCØ—:‘:˜c S¨3¡Y°%Ñ$7Ñ7¸dÈD�:ÓQˆDØ�E‰MˆDä! %§)¡)¨C°#©IÓ"6×";Ñ";Ó"=Ó>ˆMÙÜ�aœŸ™ -°Ó3Ô4Ø˜zÒ)Ø*‘
áð	ð ��c˜3à�dˆ{Ðr$   c           	     ó  — | j                   d   |j                   d   k(  r|j                  }| j                  } |dv rA| j                  «       dz  |z  }t        |«      D ]  }| dd xxx ||d |…   ||z  z  z  ccc Œ y t	        d«      ‚)Nr   ©é   rM   é   r  zOnly 2,4,8 bits are supported.)r�   ÚTÚelement_sizer•   rZ   )Úpack_tensorÚori_int_tensorrQ   Úcompress_ratioÚjs        r"   Úpack_on_row_fast_248bitz.HQQWeightOnlyQuantizer.pack_on_row_fast_248bitT  sŸ   € à×Ñ˜QÑ >×#7Ñ#7¸Ñ#:Ò:Ø+×-Ñ-ˆNØ%Ÿ-™-ˆKØ�9ÑØ(×5Ñ5Ó7¸!Ñ;¸tÑCˆNÜ˜>Ó*ò U�Ø˜A˜B“ >°!Ð2C°^Ð2CÑ#DÈÐQRÉÑ#TÑT”ñUô &Ð&FÓGÐGr$   c                ó<  — dd l }|j                  «       }	|	j                  }
||
|   |z  z
  |z  }|dk(  r+|j                  j                  j                  |	d|fdd«      }	n,|j                  j                  j                  |	ddd|fdd«      }	|	j                  }|�-|r+|dk(  r|	j                  d|g«      n|	j                  |dg«      }	|du r#|	j                  «       |	j                  «       }}d}n,|	j                  |d¬«      d   }|	j                  |d¬«      d   }d|z  dz
  }d}||g}|||z
  z  j                  d	¬
«      }||z
  }|dk(  j                  «       j                  «       dkD  r|||dk(  <   ||z  j                  d	¬
«      }| |z  }|r|j                  |«      }|r| j                  |	||||¬«      \  }}|j                  |	|z  |z   «      j                  |d   |d   «      }|j                  |«      j                  «       }d|z  }|dk(  r+|j                  |d   d«      }|j                  |d   d«      }n*|j                  d|d   «      }|j                  d|d   «      }~	~~||j                  |j                   «      |j                  |j                   «      fS )Nr   r   Úconstantr„   FTrú   r  g     ˆÓ@)Úmax)rˆ   r  r  r  rR   rð   )rt   r  r�   rò   ró   ÚpadÚreshapeÚminr  rÿ   ÚsumÚitemrþ   r  r[   rÀ   r�   )r!   rˆ   rQ   Úchannel_wiseÚ
group_sizeÚoptimizeÚ
round_zerorR   rt   ÚweightÚ	ori_shapeÚpad_lenr�   Ú_minÚ_maxÚmax_vÚmin_vr  r  Úmin_max_axisr  r	  s                         r"   Úquantize_internalz(HQQWeightOnlyQuantizer.quantize_internala  s¶  € ó 	à—‘“ˆØ—L‘Lˆ	à 	¨$¡°*Ñ <Ñ<À
ÑJˆØ�1Š9Ø—X‘X×(Ñ(×,Ñ,¨V°a¸°\À:ÈqÓQ‰Fà—X‘X×(Ñ(×,Ñ,¨V°a¸¸A¸wÐ5GÈÐUVÓWˆFØ—‘ˆð Ð"©Ø:>À!º)�V—^‘^ R¨Ð$4Ô5È&Ï.É.ÐZdÐfhÐYiÓJjˆFð ˜5Ñ ØŸ™› v§z¡z£|�$ˆDØ‰Hà—:‘: 4°�:Ó6°qÑ9ˆDØ—:‘: 4°�:Ó6°qÑ9ˆDà�4‘˜!‘ˆØˆØ˜%�.ˆð ˜$ ™+Ñ&×-Ñ-°#Ð-Ó6ˆà˜d‘{ˆØ˜AÑ×"Ñ"Ó$×)Ñ)Ó+¨aÒ/Ø.3ˆL˜¨Ñ*Ñ+Ø˜\Ñ)×0Ñ0°SÐ0Ó9ˆEØˆu�u‰}ˆáØ—;‘;˜tÓ$ˆDñ Ø×/Ñ/°vÀUÐQUÐ_fÐmqÐ/Ór‰KˆE�4ð �k‰k˜& 5™.¨4Ñ/Ó0×6Ñ6°w¸q±zÀ7È1Á:ÓNˆØ�k‰k˜%Ó ×$Ñ$Ó&ˆà�e‘ˆØ�1Š9Ø—M‘M %¨¡(¨BÓ/ˆEØ—<‘<  a¡¨"Ó-‰Dà—M‘M " e¨B¡iÓ0ˆEØ—<‘<  E¨"¡IÓ.ˆDà�D˜$à�E—H‘H˜VŸ\™\Ó*¨D¯G©G°F·L±LÓ,AÐAÐAr$   c                óÎ  — |j                   dk(  rt        d«      ‚ddl}t        j	                  d|j
                  › d�«       |j                  d   }t        ||«      \  }}|€t        j	                  d«       |gS t        j                  j                  |«      }|j                  }t        |«      d	k7  rxt        |«      d	k  rt        j	                  d
«       |gS |dd }	t        d„ |	D «       «      r"t        j	                  dt        |	«      «       |gS |j                  |d   |d   «      }nd}|j!                  |«      }
|j"                  j%                  «       r|
j#                  «       }
| j&                  j(                  }| j+                  |
j,                  || j&                  j.                  ¬«      \  }}}|j1                  «       }|j1                  «       }|j1                  «       }d|z  }|j3                  |j                  d   |j                  d   |z  f|j4                  |j6                  ¬«      }| j9                  |||«       |j;                  «       j=                  «       }|j;                  «       j=                  «       }|j                  d«      }|j                  d«      }|
j                  \  }}| j&                  j.                  }||z  }||z   dz
  |z  }|j                  |||«      }t        j                  j?                  |j;                  «       j=                  «       «      }|j
                  dz   tA        |«      z   |_        |j                  D ].  }|j
                  |k(  sŒ|j                  jC                  |«        n t        j                  j?                  |«      }|j
                  dz   |_        |jD                  jG                  ||g«       |j                  d   |j
                  |j
                  g}t        j                  j?                  |«      }|j
                  dz   |_        |jD                  jG                  |g«       |jI                  |j
                  «       i }|j                  \  }}||d<   ||d<   ||d<   | j&                  j.                  |d<   tK        |j                  d   |«      }|�t        |«      nd}|duxr |du xs ||k  } | s|jL                  d   n|jL                  d   dz   }!t        jN                  jP                  	 d||!g|j
                  r|j
                  dz   tA        |«      z   ndddœ|¤Ž}"|"g}#| rz|#jG                  tS        |j                  d   |||j
                  r|j
                  dz   tA        |«      z   n|j
                  dz   tA        |«      z   |!|jL                  d   ¬«      «       t        j	                  d|j
                  › d�«       |#S ) á½  
        Target node:        QOperator node:            QDQ nodes:
        MatMul              MatMulNBits                DeQuantizeLinear -> MatMul
        Gather              GatherBlockQuantized       Gather, Gather, Gather (optional) -> DequantizeLinear
        If the node is target node with fp32 or fp16 const weight, quantize the weight to int4 and
        return the new nodes.
        If QOperator format, return the corresponding QOperator nodes.
        If QDQ format, return the corresdponging QDQ nodes.
        Gather (quantized data) + Gather (scales) + Gather (optional, zero points) -> DequantizeLinear is
        not supported yet because Gather does not support int4 data.
        r   z/Gather quantization is not supported yet in HQQr   Nústart to quantize ú ...r   ú2MatMul doesn't have const weight. Skip to quantizer  ú<MatMul weight has fewer than 2 dimensions. Skip to quantize.éþÿÿÿc              3  ó&   K  — | ]	  }|d k7  –— Œ y­w©r   Nr,   ©Ú.0Úds     r"   ú	<genexpr>z2HQQWeightOnlyQuantizer.quantize.<locals>.<genexpr>Â  ó   è ø€ Ò+˜a�1˜•6Ñ+ùó   ‚úcMatMul weight has non-unit batch dims %s; N-D batched quantization not supported. Skip to quantize.r„   )rQ   r"  r  )r�   rn   Ú_QÚ_scalesÚ_zero_pointsÚKÚNrQ   rG   Ú_pre_reshapeÚ úcom.microsoft©rœ   Úoutputsr­   Údomain©Úa_input_nameÚb_original_shapeÚtarget_graphÚname_prefixÚpre_reshape_outputÚfinal_outputúcomplete quantization of ©ÚMatMulNBits)*Úop_typerZ   rt   ÚloggerÚinfor­   ÚinputÚget_initializerÚonnxÚnumpy_helperÚto_arrayr�   rÁ   Úanyr‡   r  Ú
from_numpyrf   r{   r™   rQ   r-  r  rG   rŠ   r—   Úuint8rn   r  rg   rÆ   Ú
from_arrayr%   ÚremoveÚinitializerÚextendrÄ   Ú_get_static_rankÚoutputÚhelperÚ	make_nodeÚ_build_nbits_output_reshape)$r!   ÚnodeÚgraph_stackrt   Úinput_bÚb_pbÚbs_graphÚb_arrayrK  ÚleadingÚb_array_torchrQ   Úquant_weight_torchÚscales_torchÚzero_points_torchÚpacked_sizeÚpacked_torchÚscalesÚzero_pointsÚrowsÚcolsrG   Ú	blob_sizeÚk_blocksÚb_quantrV  Úscales_tensorÚinput_namesÚ	zp_tensorÚkwargsÚa_static_rankÚrank_b_origÚneeds_reshapeÚmatmul_q_outputÚmatmul_q_nodeÚoutput_nodess$                                       r"   ÚquantizezHQQWeightOnlyQuantizer.quantize¢  sr  € ð �<‰<˜8Ò#Ü%Ð&WÓXÐXãä�‰Ð(¨¯©¨°4Ð8Ô9Ø—*‘*˜Q‘-ˆÜ(¨°+Ó>‰ˆˆhØˆ<Ü�K‰KÐLÔMØ�6ˆMä×#Ñ#×,Ñ,¨TÓ2ˆØ"Ÿ=™=ÐÜÐÓ  AÒ%ÜÐ#Ó$ qÒ(Ü—‘ÐZÔ[Ø�v�Ø& s¨Ð+ˆGÜÑ+ 7Ô+Ô+Ü—‘ð(ä˜“Môð
 �v�à—o‘oÐ&6°rÑ&:Ð<LÈRÑ<PÓQ‰Gà#ÐØ×(Ñ(¨Ó1ˆØ�:‰:×"Ñ"Ô$Ø)×.Ñ.Ó0ˆMà�{‰{×ÑˆØ>B×>TÑ>TØ�O‰O $°4·;±;×3IÑ3Ið ?Uó ?
Ñ;Ð˜LÐ*;ð 0×:Ñ:Ó<ÐØ#×.Ñ.Ó0ˆØ-×8Ñ8Ó:Ðà˜4‘iˆà—{‘{Ø×%Ñ% aÑ(Ð*<×*BÑ*BÀ1Ñ*EÈÑ*TÐUØ—+‘+Ø%×,Ñ,ð #ó 
ˆð
 	×$Ñ$ \Ð3EÀtÔLØ×!Ñ!Ó#×)Ñ)Ó+ˆØ'×+Ñ+Ó-×3Ñ3Ó5ˆà—‘ Ó#ˆØ!×)Ñ)¨"Ó-ˆØ"×(Ñ(‰
ˆˆdØ—[‘[×+Ñ+ˆ
Ø +Ñ-ˆ	Ø˜:Ñ%¨Ñ)¨jÑ8ˆØ#×+Ñ+¨D°(¸IÓFˆä×#Ñ#×.Ñ.¨|×/?Ñ/?Ó/A×/GÑ/GÓ/IÓJˆØ—y‘y 4Ñ'¬#¨d«)Ñ3ˆŒØ—^‘^ò 	ˆEØ�z‰z˜WÓ$Ø—‘×%Ñ% eÔ,Ùð	ô
 ×)Ñ)×4Ñ4°VÓ<ˆØ!ŸY™Y¨Ñ2ˆÔØ×Ñ×#Ñ# W¨mÐ$<Ô=à—z‘z !‘} g§l¡l°M×4FÑ4FÐGˆÜ×%Ñ%×0Ñ0°Ó=ˆ	ØŸ™ ^Ñ3ˆ	ŒØ×Ñ×#Ñ# Y KÔ0Ø×Ñ˜9Ÿ>™>Ô*àˆØ—]‘]‰
ˆˆdØˆˆs‰Øˆˆs‰Øˆˆv‰Ø#Ÿ{™{×5Ñ5ˆˆ|Ñô )¨¯©°A©¸ÓDˆØ/?Ð/K”cÐ*Ô+ÐQRˆØ(°Ð4Òo¸-È4Ð:OÒ:nÐS`ÐcnÑSnˆÙ0=˜$Ÿ+™+ aš.À4Ç;Á;ÈqÁ>ÐTbÑCbˆÜŸ™×-Ñ-Øð
àØ$Ð%Ø15·²�—‘˜TÑ!¤C¨£IÒ-ÀØ"ñ
ð ñ
ˆð &�ˆÙð ×ÑÜ+Ø!%§¡¨A¡Ø%5Ø!)ØBFÇ)Â) §¡¨TÑ!1´C¸³IÒ!=ÐRV×R[ÑR[Ð^bÑRbÔehÐimÓenÑRnØ'6Ø!%§¡¨Q¡ôô	ô 	�‰Ð/°·	±	¨{¸$Ð?Ô@àÐr$   )r™   rL   )r   NF)r  z	list[int]rR   r[   r  r(   )rM   Té@   TTr   ©rg  r   rh  úlist[GraphProto]Úreturnúlist[NodeProto])	r)   r*   r+   r#   Ústaticmethodr  r  r-  r…  r,   r$   r"   rä   rä     sw   „ ðà(óð ð Ø"&Øð2ð ð	2ð
 ð2ð  ò2ó ð2ðh ñ	Hó ð	Hð fgó?BôBEr$   rä   c                óš   — t        t        |«      dz
  dd«      D ]/  }||   }|j                  D ]  }|j                  | k(  sŒ||fc c S  Œ1 y)Nr   r„   )NN)r•   rÁ   r`  r­   )r­   Ú
graph_pathÚgidÚgraphrˆ   s        r"   rW  rW  *  s\   € Ü”S˜“_ qÑ(¨"¨bÓ1ò %ˆØ˜3‘ˆØ×'Ñ'ò 	%ˆFØ�{‰{˜dÓ"Ø˜u�}Ô$ñ	%ð%ð
 r$   c                óŽ  — t        t        |«      dz
  dd«      D ]©  }||   }t        |j                  «      t        |j                  «      z   t        |j
                  «      z   D ]^  }|j                  | k(  sŒ|j                  j                  }|j                  d«      r#t        |j                  j                  «      c c S   y Œ« y)u†  Return the static rank of a tensor if its shape is known, else None.

    Searches graph inputs, value_info, and outputs in the graph stack (inner-most
    graph first).  A known shape requires ``HasField('shape')`` to be true on the
    tensor_type; the rank is then ``len(shape.dim)``.  Individual dim sizes may
    still be symbolic â€” only the rank (dimension count) matters here.
    r   r„   r�   N)r•   rÁ   r‡   rV  Ú
value_inforc  r­   ÚtypeÚtensor_typeÚHasFieldr�   Údim)Útensor_namer�  rŽ  r�  ÚviÚtts         r"   rb  rb  3  s¦   € ô ”S˜“_ qÑ(¨"¨bÓ1ò ˆØ˜3‘ˆÜ�u—{‘{Ó#¤d¨5×+;Ñ+;Ó&<Ñ<¼tÀEÇLÁLÓ?QÑQò 	ˆBØ�w‰w˜+Ó%Ø—W‘W×(Ñ(�Ø—;‘;˜wÔ'Ü˜rŸx™xŸ|™|Ó,Ô,Úñ	ðð r$   c                ó^	  — t        |«      }|d   }|dz   |z   }|dz   }	|dz   }
|dz   }|dz   }|dz   }|dz   }|d	z   }|d
z   }|j                  j                  t        j                  j                  t        j                  dt        j                  ¬«      |	¬«      t        j                  j                  t        j                  dt        j                  ¬«      |
¬«      t        j                  j                  t        j                  dt        j                  ¬«      |¬«      t        j                  j                  t        j                  dgt        j                  ¬«      |¬«      t        j                  j                  t        j                  |t        j                  ¬«      |¬«      t        j                  j                  t        j                  |gt        j                  ¬«      |¬«      t        j                  j                  t        j                  dgt        j                  ¬«      |¬«      g«       |dz   }|dz   }|dz   }|dz   }|dz   }|dz   }|dz   }|dz   }|dz   }|dz   }|dz   }|dz   }t        j                  j                  d| g|g|dz   ¬«      t        j                  j                  d|g|g|dz   ¬«      t        j                  j                  d||	g|g|d z   ¬«      t        j                  j                  d!||g|g|d"z   ¬«      t        j                  j                  d#||g|g|d$z   ¬«      t        j                  j                  d!||	g|g|d%z   ¬«      t        j                  j                  d&||g|g|d'z   ¬«      t        j                  j                  d(|g|g|d)z   t        j                  j                  |t        j                  dgdg¬*«      ¬+«      t        j                  j                  d#||
g|g|d,z   ¬«      t        j                  j                  d&||g|g|d-z   ¬«      t        j                  j                  d.||||g|g|d/z   ¬«      t        j                  j                  d0|||g|g|d1z   d¬2«      t        j                  j                  d&||g|g|d3z   ¬«      g}|S )4uß  Build the reshape chain that restores the ONNX MatMul-broadcast output shape.

    MatMulNBits produces shape ``[...A_batch_dims, M, N]`` (rank = rank(A)). To match
    the original ``MatMul(A, B_orig)`` output, where B_orig has all-unit leading
    dims, we need:

        a_rank_eff = max(rank(A), 2)   # ONNX promotes 1-D A to rank-2
        out_shape = [1] * max(rank(B_orig) - a_rank_eff, 0) + A.shape[:-1] + [N]

    This is built dynamically via Shape/Gather/Max/Sub/Max/ConstantOfShape/Slice/Concat
    so it works regardless of A's static rank (handles rank(A) == 1, rank(A) == 2
    â€” the common transformer case â€” as well as rank(A) >= rank(B_orig) where no
    leading-1 prepending is needed). All ops used are valid from opset 11 onward.

    Args:
        a_input_name: name of the activation input edge (A) feeding MatMulNBits.
        b_original_shape: the original (pre-squeeze) shape of B, e.g. ``(1, K, N)``.
        target_graph: graph proto to append helper initializers into.
        name_prefix: unique prefix for generated node/initializer names.
        pre_reshape_output: name of the MatMulNBits output edge (the input of the
            generated Reshape).
        final_output: name of the final edge produced by the generated Reshape
            (must match the original MatMul output edge).

    Returns:
        List of nodes to append to the consumer's ``output_nodes`` after the
        MatMulNBits node. Initializers are appended to ``target_graph`` in place.
    r„   Ú_Ú_zeroÚ_oneÚ_twoÚ_one_vecÚ_rank_bÚ_n_vecÚ	_zero_vecÚ
_one_valuer   ©r�   ©r­   r   r  Ú_a_shapeÚ_a_shape_of_shapeÚ_a_rankÚ_a_rank_effÚ
_extra_rawÚ_extra_countÚ_extra_count_vecÚ_extra_onesÚ
_a_rank_m1Ú_a_rank_m1_vecÚ_a_prefix_shapeÚ_target_shapeÚShapeÚ_shape_aÚ_shape_of_a_shaper   Ú_gather_rankÚMaxÚ_max_rank_effÚSubÚ_subr)  ÚReshapeÚ_reshape_extraÚConstantOfShapeÚ_const_ones)r­   Ú	data_typeÚdimsÚvals)r­   ÚvalueÚ_sub_oneÚ_reshape_rank_m1ÚSliceÚ_slice_a_prefixÚConcatÚ_concat_target)r­   rR   Ú_reshape_out)rÁ   r`  ra  rX  rY  r^  rÞ   Úarrayr‰   rd  re  Úmake_tensorr   ÚINT64)rJ  rK  rL  rM  rN  rO  r€  Ún_dimrø   Ú	init_zeroÚinit_oneÚinit_twoÚinit_one_vecÚinit_rank_bÚ
init_n_vecÚinit_zero_vecÚinit_one_value_templateÚa_shapeÚa_shape_of_shapeÚa_rankÚ
a_rank_effÚ	extra_rawÚextra_countÚextra_count_vecÚ
extra_onesÚa_rank_minus_oneÚa_rank_minus_one_vecÚa_prefix_shapeÚtarget_shapeÚnodess                                 r"   rf  rf  F  s³  € ôH Ð&Ó'€KØ˜RÑ €Eð 	�cÑ˜LÑ(€AØ�G‘€IØ�6‰z€HØ�6‰z€HØ�z‘>€LØ�i‘-€KØ�X‘€JØ˜‘O€MØ ,Ñ.Ðà×Ñ×#Ñ#ä×Ñ×(Ñ(¬¯©°!¼2¿8¹8Ô)DÈ9Ð(ÓUÜ×Ñ×(Ñ(¬¯©°!¼2¿8¹8Ô)DÈ8Ð(ÓTÜ×Ñ×(Ñ(¬¯©°!¼2¿8¹8Ô)DÈ8Ð(ÓTÜ×Ñ×(Ñ(¬¯©°1°#¼R¿X¹XÔ)FÈ\Ð(ÓZÜ×Ñ×(Ñ(¬¯©°+ÄRÇXÁXÔ)NÐU`Ð(ÓaÜ×Ñ×(Ñ(¬¯©°5°'ÄÇÁÔ)JÐQ[Ð(Ó\Ü×Ñ×(Ñ(¬¯©°1°#¼R¿X¹XÔ)FÈ]Ð(Ó[ð	
ô
ð �*‰n€GØÐ.Ñ.ÐØ�‰]€FØ�]Ñ"€JØ�LÑ €IØ�nÑ$€KØÐ,Ñ,€OØ�]Ñ"€JØ˜<Ñ'ÐØÐ/Ñ/ÐØÐ*Ñ*€NØ�Ñ&€Lô 	�‰×Ñ˜g¨ ~¸°yÀqÈ:Á~ÐÓVô
 	�‰×Ñ˜g¨ yÐ3CÐ2DÈ1ÐObÑKbÐÓcÜ�‰×Ñ˜hÐ)9¸9Ð(EÈÀxÐVWÐZhÑVhÐÓiô 	�‰×Ñ˜e f¨hÐ%7¸*¸ÈAÐP_ÑL_ÐÓ`Ü�‰×Ñ˜e k°:Ð%>ÀÀÐRSÐV\ÑR\ÐÓ]Ü�‰×Ñ˜e i°Ð%;¸k¸]ÐQRÐU[ÑQ[ÐÓ\Ü�‰×Ñ˜i¨+°|Ð)DÀÐFWÐ^_ÐbrÑ^rÐÓsÜ�‰×ÑØØÐØˆLØ�]Ñ"Ü—+‘+×)Ñ)Ø,Ü%×+Ñ+Ø�SØ�Sð	 *ó ð 	ó 	
ô 	�‰×Ñ˜e f¨hÐ%7Ð:JÐ9KÐRSÐV`ÑR`ÐÓaÜ�‰×ÑØÐ(¨,Ð7Ð:NÐ9OÐVWÐZlÑVlð 	ó 	
ô 	�‰×ÑØØ�mÐ%9¸=ÐIØÐØÐ&Ñ&ð	 	ó 	
ô 	�‰×ÑØØ˜¨Ð4ØˆNØÐ%Ñ%Øð 	ó 	
ô 	�‰×ÑØØ Ð.ØˆNØ�^Ñ#ð	 	ó 	
ðY2€Eðf €Lr$   c                ób  — ||z  }| dz	  dz  }| dz  }t        j                  |t         j                  ¬«      }||dd d…<   ||dd d…<   |j                  ||f«      }|j                  }|j                  d«      }	|	dd d…   dz  dz  |	dd d…   dz  z  } | j                  t         j                  «      S )	NrM   é   r£  r   r  r   r„   éð   )rÞ   Úemptyr]  r  r  Úastype)
Úpackedrv  rw  ÚtotalÚhighÚlowÚ	int4_valsÚint4_matrixÚint4_matrix_transposedÚflats
             r"   Útranspose_packed_int4_matrixrî  É  sÅ   € à�4‰K€EØ�a‰K˜4Ñ€DØ
�4‰-€CÜ—‘˜¤b§h¡hÔ/€IØ€Iˆaˆd�ˆd�OØ€Iˆaˆd�ˆd�OØ×#Ñ# T¨4 LÓ1€Kð )Ÿ]™]Ðð "×)Ñ)¨"Ó-€DØ�A�D�q�D‰z˜Q‰ $Ñ&¨4°°°1°©:¸Ñ+<Ñ=€FØ�=‰=œŸ™Ó"Ð"r$   c                  ó�   — e Zd Zdd„Zdd„Zdd„Zedd„«       Zedd„«       Zedd„«       Z	e	 	 	 	 	 	 	 	 	 	 dd„«       Z
dd„Zdd	„Zy
)ÚDefaultWeightOnlyQuantizerc                ó   — || _         y rÝ   ræ   rç   s     r"   r#   z#DefaultWeightOnlyQuantizer.__init__Ý  s	   € Øˆ�r$   c           
     óü  — | j                   j                  }d|z  }t        |j                  «      dk7  rt	        d«      ‚|j                  \  }}| j                   j
                  }||z   dz
  |z  }| j                   j                  t        j                  k(  �r||z   dz
  |z  }||z  }	|	|z
  }
|
dkD  rt        j                  |d|
fdfd«      }t        j                  |||fd¬	«      }t        j                  |||z   dz
  |z  fd¬	«      }t        j                  ||f|j                  ¬	«      }|dk(  r(t        |||||||| j                   j                  «       �n!|dk(  r't        |||||||| j                   j                  «       nõt!        |||||||| j                   j                  «       nÎ| j                   j"                  r|n| j                   j
                  }||z   dz
  |z  }|d
k(  sJ d«       ‚t        j                  ||z  dz   dz  d¬	«      }t        j                  ||z  dz   dz  d¬	«      }t        j                  ||f|j                  ¬	«      }t%        |||||||| j                   j                  «       |||fS )z54b/8b quantize fp32 weight to int4 using C++ kernels.r  r  z9Current int4 block quantization only supports 2D tensors!r   r   )r   r   r  r]  r£  rM   z+QDQ format only support 4 bits quantization)r™   rQ   rÁ   r�   r¾   rG   r   r   r3   rÞ   r  r—   r�   r   rW   r
   r	   rY   r   )r!   Ú
fp32weightÚqbitsÚkpackrv  rw  rG   ry  rx  Úpadded_rowsr'  ræ  Ú
zero_pointrt  s                 r"   Úqbits_block_quantz,DefaultWeightOnlyQuantizer.qbits_block_quantà  s|  € ð —‘× Ñ ˆØ�U‘
ˆÜˆz×ÑÓ  AÒ%ÜÐXÓYÐYØ×%Ñ%‰
ˆˆdà—[‘[×+Ñ+ˆ
Ø˜:Ñ%¨Ñ)¨jÑ8ˆà�;‰;×#Ñ#¤{×'<Ñ'<Ó<Ø# eÑ+¨aÑ/°EÑ9ˆIØ" ZÑ/ˆKØ! DÑ(ˆGØ˜Š{ÜŸV™V J°!°W°¸vÐ0FÈ
ÓS�
ô —X‘X˜t X¨yÐ9ÀÔIˆFÜŸ™ 4¨8°eÑ+;¸aÑ+?ÀEÑ*IÐ"KÐSZÔ[ˆJÜ—X‘X˜t XÐ.°j×6FÑ6FÔGˆFØ˜ŠzÜ%Ø˜J¨°
¸JÈÈdÐTX×T_ÑT_×TlÑTlöð ˜!’Ü%Ø˜J¨°
¸JÈÈdÐTX×T_ÑT_×TlÑTlõô &Ø˜J¨°
¸JÈÈdÐTX×T_ÑT_×TlÑTlõð
 "&§¡×!CÒ!C™ÈÏÉ×I_ÑI_ˆJØ˜zÑ)¨AÑ-°*Ñ<ˆHà˜A’:ÐLÐLÓL�:Ü—X‘X˜t d™{¨Q™°1Ñ4¸GÔDˆFÜŸ™ 4¨(¡?°QÑ#6¸1Ñ"<ÀGÔLˆJÜ—X‘X˜x¨Ð.°j×6FÑ6FÔGˆFÜ%Ø˜
 F¨J¸
ÀDÈ$ÐPT×P[ÑP[×PhÑPhôð ˜ 
Ð+Ð+r$   c                ó(  — | j                   j                  }|dk(  r7| j                   j                  rt        j                  nt        j
                  }n6| j                   j                  rt        j                  nt        j                  }|j                  d   }t        ||«      \  }}|€t        j                  d«       |gS t        j                  |«      j                  «       }|j                  }	t!        |	«      dk7  rxt!        |	«      dk  rt        j                  d«       |gS |	dd }
t#        d„ |
D «       «      r"t        j                  d	t%        |
«      «       |gS |j'                  |	d   |	d
   «      }nd}	|j(                  dk(  }|r|j+                  t,        j.                  «      }| j1                  |«      \  }}}|r|j+                  t2        j4                  «      }| j                   j6                  t8        j:                  k(  r†t        j<                  j?                  t        j@                  ||jB                  d|› �z   ¬«      «      }t        j<                  j?                  t        j@                  ||jB                  dz   ¬«      «      }nŒtD        jF                  jI                  |jB                  d|› �z   ||j                  |jK                  «       d«      }t        j<                  j?                  t        j@                  ||jB                  dz   ¬«      «      }| j                   j6                  t8        jL                  k(  xr. | j                   jN                  xr | j                   j                  }|r³|j                  \  }}tQ        |||«      }|j'                  |df«      }tD        jF                  jI                  |jB                  d|› �z   |||g|jK                  «       d«      }t        j<                  j?                  t        j@                  ||jB                  dz   ¬«      «      }|j                  D ].  }|jB                  |k(  sŒ|j                  jS                  |«        n |jT                  jW                  ||g«       g }| j                   j6                  t8        j:                  k(  �r%|j                  d   |jB                  |jB                  g}| j                   j                  sdtD        jX                  j[                  ||jB                  dz   «      }|j]                  |jB                  «       |jT                  jW                  |g«       i }|j                  \  }}||d<   ||d<   ||d<   | j                   j^                  |d<   | j                   j`                  r| j                   j`                  |d<   tc        |j                  d   |«      }|	�t!        |	«      nd}|	duxr |du xs ||k  }|s|jd                  d   n|jd                  d   dz   }tE        jF                  jf                  	 d'||g|jB                  r|jB                  d|› �z   ndddœ|¤Ž}|j]                  |«       |rh|jW                  ti        |j                  d   |	||jB                  r|jB                  d|› �z   n|jB                  d|› �z   ||jd                  d   ¬«      «       |S |jB                  |jB                  g}|jB                  dz   g}|d   g} |d   dz   g}!|j                  d   |r|!d   n|d   g}"tc        |j                  d   |«      }|	�t!        |	«      nd}|	duxr |du xs ||k  }|s|jd                  d   n|jd                  d   dz   }#|#g}$| j                   j                  stD        jF                  jI                  |jB                  d z   ||j                  |jK                  «       d«      }|j]                  |jB                  «       |jT                  jW                  |g«       |j                  \  }}|rdnd| j                   jN                  r|n| j                   j^                  d!œ}%tE        jF                  jf                  	 d(|||jB                  r|jB                  d|› �z   ndd"œ|%¤Ž}&tD        jF                  jg                  d#|"|$|jB                  r|jB                  d$|› �z   nd¬"«      }'|r:tD        jF                  jg                  d%| |!ddg¬&«      }(|jW                  |&|(|'g«       n|jW                  |&|'g«       |rh|jW                  ti        |j                  d   |	||jB                  r|jB                  d|› �z   n|jB                  d|› �z   |#|jd                  d   ¬«      «       |S ))a  
        Quantize weight B of MatMul node to int4 or int8.
        Supports 2D constant matrix, and N-D constant matrices whose leading dimensions are all 1
        (which are squeezed to 2D before quantization). Axis 0 blockwise quantization only.
        r  r   Nr2  r  r3  r4  c              3  ó&   K  — | ]	  }|d k7  –— Œ y­wr6  r,   r7  s     r"   r:  z=DefaultWeightOnlyQuantizer.quantize_matmul.<locals>.<genexpr>*  r;  r<  r=  r„   Úbfloat16r>  r¤  r?  Ú_DQ_QTÚ
_DQ_scalesr   r@  rA  rB  rQ   rG   rX   rC  rD  rE  rF  rI  Ú_outputÚ_transposedÚ_DQ_zero_points)rR   rG   )rœ   rG  r­   r   Ú	_matmul_QÚ	Transpose)rœ   rG  ÚpermrQ  )ÚDequantizeLinear)5r™   rQ   rW   r   ÚINT8ÚUINT8ÚINT4ÚUINT4rV  rW  rT  rU  ÚirÚ
from_protorÆ   r�   rÁ   r[  r‡   r  r�   rå  rÞ   r�   rø  Ú	ml_dtypesrû  r   r   r3   ÚserdeÚserialize_tensorÚTensorr­   rX  rd  rÉ  Útobytesrz   rY   rî  r_  r`  ra  rY  r^  rÄ   rG   rX   rb  rc  re  rf  ))r!   rg  rh  rQ   Úqtyperi  Úb_tensorÚb_graphÚ	b_ndarrayrK  rm  rû  ræ  rt  ru  rz  r{  Úqdq_opt_for_intel_npu_enabledrv  rw  rV  r„  r|  r}  r~  r  r€  r�  Ú
qop_outputÚmatmul_qbit_nodeÚdq_input_namesÚdq_output_namesÚtp_input_namesÚtp_output_namesÚmatmul_input_namesÚqdq_matmul_outÚmatmul_output_namesÚ	dq_kwargsÚdq_nodeÚmatmul_nodeÚtp_nodes)                                            r"   Úquantize_matmulz*DefaultWeightOnlyQuantizer.quantize_matmul  s‘  € ð �{‰{×ÑˆØ�1Š9Ø(,¯©×(@Ò(@”K×$Ò$Äk×FWÑFW‰Eà(,¯©×(@Ò(@”K×$Ò$Äk×FWÑFWˆEØ—*‘*˜Q‘-ˆÜ+¨G°[ÓAÑˆ�'ØÐÜ�K‰KÐLÔMØ�6ˆMä—M‘M (Ó+×1Ñ1Ó3ˆ	Ø$Ÿ?™?ÐÜÐÓ  AÒ%ÜÐ#Ó$ qÒ(Ü—‘ÐZÔ[Ø�v�Ø& s¨Ð+ˆGÜÑ+ 7Ô+Ô+Ü—‘ð(ä˜“Môð
 �v�à!×)Ñ)Ð*:¸2Ñ*>Ð@PÐQSÑ@TÓU‰Ià#Ðà—?‘? jÑ0ˆÙØ!×(Ñ(¬¯©Ó4ˆIà&*×&<Ñ&<¸YÓ&GÑ#ˆ�˜ÙØ—]‘]¤9×#5Ñ#5Ó6ˆFà�;‰;×#Ñ#¤{×'<Ñ'<Ò<Ü—h‘h×/Ñ/´·	±	¸&ÀxÇ}Á}ÐY[Ð\`Ð[aÐWbÑGbÔ0cÓdˆGÜŸH™H×5Ñ5´b·i±iÀÈXÏ]É]Ð]fÑMfÔ6gÓh‰Mä—k‘k×-Ñ-Ø—‘ %¨ v Ñ.°°y·±ÈÏÉÓHXÐZ^óˆGô ŸH™H×5Ñ5´b·i±iÀÈXÏ]É]Ð]iÑMiÔ6jÓkˆMð �K‰K×$Ñ$¬¯©Ñ7ò )Ø—‘×2Ñ2ò)à—‘×(Ñ(ð 	&ñ
 )Ø"Ÿ™‰JˆD�$Ü1°&¸$ÀÓEˆFØ—^‘^ T¨1 IÓ.ˆFÜ—k‘k×-Ñ-Ø—‘ %¨ v Ñ.°¸¸d°|ÀVÇ^Á^ÓEUÐW[óˆGô ŸH™H×5Ñ5´b·i±iÀÈXÏ]É]Ð]iÑMiÔ6jÓkˆMà—]‘]ò 	ˆEØ�z‰z˜WÓ$Ø—‘×$Ñ$ UÔ+Ùð	ð
 	×Ñ×"Ñ" G¨]Ð#;Ô<àˆà�;‰;×#Ñ#¤{×'<Ñ'<Ó<ØŸ:™: a™=¨'¯,©,¸×8JÑ8JÐKˆKØ—;‘;×+Ò+Ü ×-Ñ-×8Ñ8¸ÀhÇmÁmÐVdÑFdÓe�	Ø×"Ñ" 9§>¡>Ô2Ø×#Ñ#×*Ñ*¨I¨;Ô7ØˆFØ"Ÿ™‰JˆD�$ØˆF�3‰KØˆF�3‰KØ!ˆF�6‰NØ#'§;¡;×#9Ñ#9ˆF�<Ñ ð �{‰{×)Ò)Ø+/¯;©;×+EÑ+E�Ð'Ñ(ô -¨T¯Z©Z¸©]¸KÓHˆMØ3CÐ3Oœ#Ð.Ô/ÐUVˆKØ,°DÐ8Òs¸mÈtÐ>SÒ>rÐWdÐgrÑWrˆMÙ/<˜Ÿ™ QšÀ$Ç+Á+ÈaÁ.ÐSaÑBaˆJÜ#Ÿ{™{×4Ñ4Øð à"Ø#˜Ø04·	²	�T—Y‘Y 2 d V Ò,¸rØ&ñ ð ñ Ðð ×ÑÐ 0Ô1ÙØ×#Ñ#Ü/Ø%)§Z¡Z°¡]Ø)9Ø%,ØAEÇÂ T§Y¡Y°2°d°V°Ò%<ÐQY×Q^ÑQ^ÐceÐfjÐekÐalÑQlØ+5Ø%)§[¡[°¡^ôô	ðP Ðð{ &Ÿl™l¨M×,>Ñ,>Ð?ˆNØ&Ÿ|™|¨iÑ7Ð8ˆOØ-¨aÑ0Ð1ˆNØ.¨qÑ1°MÑAÐBˆOà—
‘
˜1‘Ù&C� Ò"ÈÐYZÑI[ð"Ðô -¨T¯Z©Z¸©]¸KÓHˆMØ3CÐ3Oœ#Ð.Ô/ÐUVˆKØ,°DÐ8Òs¸mÈtÐ>SÒ>rÐWdÐgrÑWrˆMÙ3@˜TŸ[™[¨š^ÀdÇkÁkÐRSÁnÐWeÑFeˆNØ#1Ð"2ÐØ—;‘;×+Ò+Ü ŸK™K×3Ñ3Ø—M‘MÐ$5Ñ5°u¸f¿l¹lÈK×L_ÑL_ÓLaÐcgó�	ð ×%Ñ% i§n¡nÔ5Ø×#Ñ#×*Ñ*¨I¨;Ô7Ø"Ÿ™‰JˆD�$á:™ÀØ&*§k¡k×&HÒ&H™dÈdÏkÉk×NdÑNdñˆIô —k‘k×+Ñ+Ø"ðà%Ø'Ø37·9²9�T—Y‘Y 5¨¨ Ò/À"ñ	ð
 ñˆGô Ÿ+™+×/Ñ/ØØ)Ø+Ø7;·y²y�T—Y‘Y 9¨T¨FÐ!3Ò3Àbð	 0ó ˆKñ -ÜŸ+™+×/Ñ/ØØ)Ø+Ø˜Q˜ð	 0ó �ð ×#Ñ# W¨g°{Ð$CÕDà×#Ñ# W¨kÐ$:Ô;ÙØ×#Ñ#Ü/Ø%)§Z¡Z°¡]Ø)9Ø%,ØDHÇIÂI T§Y¡Y°5¸¸°Ò%?ÐT\×TaÑTaÐfkÐlpÐkqÐdrÑTrØ+9Ø%)§[¡[°¡^ôô	ð Ðr$   c                ó¤  — t        j                  | dd¬«      }t        j                  | dd¬«      }t        j                  t        j                  |«      t        j                  |«      kD  ||«      }|dz  }t        j                  |dk(  d| |z  «      j                  «       j                  dd«      j                  t         j                  «      }||fS )Nr   T©rR   Úkeepdimsg       Àr   iøÿÿÿé   )	rÞ   r  r  Úwhererõ   rþ   Úcliprå  Úint8)rÕ   Úmax_valÚmin_valÚabs_maxr  Úquantized_slices         r"   Úquant_slice_symmetricz0DefaultWeightOnlyQuantizer.quant_slice_symmetricË  s¤   € ä—&‘&˜ A°Ô5ˆÜ—&‘&˜ A°Ô5ˆÜ—(‘(œ2Ÿ6™6 '›?¬R¯V©V°G«_Ñ<¸gÀwÓOˆà˜$‘ˆÜŸ(™( 5¨A¡:¨q°$¸±,Ó?×EÑEÓG×LÑLÈRÐQRÓS×ZÑZÔ[]×[bÑ[bÓcˆà Ð%Ð%r$   c                ó   — t        j                  | j                  dd¬«      d«      }t        j                  | j	                  dd¬«      d«      }||z
  dz  }t        j
                  |dk(  d| |z  «      j                  «       j                  dd«      j                  t         j                  «      }t        j
                  |dk(  d| |z  |z   «      j                  «       j                  dd«      j                  t         j                  «      }|||fS )Nr   Tr$  r   g      .@r  râ  )
rÞ   Úminimumr  Úmaximumr  r'  rþ   r(  rå  r]  )rÕ   r+  r*  r  r÷  r-  s         r"   Úquant_slice_asymmetricz1DefaultWeightOnlyQuantizer.quant_slice_asymmetricÖ  sæ   € ä—*‘*˜TŸX™X¨1°t˜XÓ<¸aÓ@ˆÜ—*‘*˜TŸX™X¨1°t˜XÓ<¸aÓ@ˆà˜7Ñ" dÑ*ˆÜ—X‘X˜e q™j¨!¨g¨X¸Ñ-=Ó>×DÑDÓF×KÑKÈAÈrÓR×YÑYÔZ\×ZbÑZbÓcˆ
ÜŸ(™( 5¨A¡:¨q°$¸±,ÀÑ2KÓL×RÑRÓT×YÑYÐZ[Ð]_Ó`×gÑgÔhj×hpÑhpÓqˆà  zÐ1Ð1r$   c                óÈ   — | j                  d«      }t        |«      dz  dk7  rt        j                  |d«      }|ddd…   dz  |ddd…   dz  dz  z  }|j	                  d«      S )	z2Pack int8 data to int4 and store in uint8 ndarray.r„   r  r   Nrâ  r   rM   r]  )r  rÁ   rÞ   rÄ   rå  )rÕ   Ú	data_flatÚquant_data_int4s      r"   Úpack_int8_to_int4z,DefaultWeightOnlyQuantizer.pack_int8_to_int4á  so   € ð —L‘L Ó$ˆ	Üˆy‹>˜AÑ Ò"ÜŸ	™	 )¨QÓ/ˆIØ$¡S q S™>¨CÑ/°Y¸q¸tÀ!¸t±_ÀsÑ5JÈqÑ4PÑQˆà×%Ñ% gÓ.Ð.r$   c                ó¨  — d}| j                   |   }d}t        | j                   «      D ]  \  }}||k  r||z  }Œ||kD  sŒ||z  }Œ ||z   dz
  |z  }	t        | j                   «      }
|	|
|<   | j                  |||f«      }t	        j
                  ||	|f| j                  ¬«      }|rt	        j
                  |||fd¬«      }n4t	        j
                  |||fd¬«      }t	        j
                  ||	|fd¬«      }t        d||«      D ]‹  }t        ||z   |«      }|dd…||…dd…f   }|rt        j                  |«      \  }}nt        j                  |«      \  }}}||dd…||…dd…f<   ||z  }||dd…||dz   …dd…f<   |rŒ{dd…||dz   …dd…f<   Œ� t        j                  |«      }d}|st        j                  «      }|j                  |
«      }|||fS )zXQuantize ndarray data to int4 using numpy, return (quantized data, scales, zero points).r   r£  r)  r]  r   N)r�   rÃ   r‡   r  rÞ   r—   r�   r•   r  rð  r.  r2  r6  )rÕ   Úquantize_axisrG   rW   ÚmÚkÚnr¢   r•  ry  Úscales_shapeÚdata_reshapert  Úquant_data_int8Úzero_point_int8Úend_idxÚsliceÚquantized_slice_int8Úscale_sliceÚzero_point_slice_int8r  r5  Úzero_point_int4s                          r"   Úquantize_ndarrayz+DefaultWeightOnlyQuantizer.quantize_ndarrayë  s  € ð ˆØ�J‰J�}Ñ%ˆØˆÜ §
¡
Ó+ò 	‰FˆAˆsØ�=Ò Ø�S‘‘Ø�]Ó"Ø�S‘‘ð		ð ˜
‘N QÑ&¨:Ñ5ˆÜ˜DŸJ™JÓ'ˆØ&.ˆ�]Ñ#à—|‘| Q¨¨1 IÓ.ˆÜ—‘˜1˜h¨Ð*°$·*±*Ô=ˆÙÜ Ÿh™h¨¨1¨a y¸Ô?‰Oä Ÿh™h¨¨1¨a y¸Ô@ˆOÜ Ÿh™h¨¨8°QÐ'7¸wÔGˆOô �q˜!˜ZÓ(ò 	KˆAÜ˜!˜j™.¨!Ó,ˆGØ ¢ A g Iªq Ñ1ˆEáÜ4N×4dÑ4dÐejÓ4kÑ1Ð$¡kô /×EÑEÀeÓLñ IÐ$ kÐ3Hð 0DˆOšA˜q ˜yª!˜OÑ,Ø�Z‘ˆAØ(3ˆF’1�a˜1˜q™5�k¢1Ð$Ñ%ÚØ5J�¢ 1¨¨A© ;²Ð 1Ò2ð	Kô$ 5×FÑFÀÓWˆØˆÙÜ8×JÑJÈ?Ó[ˆOØ—‘ Ó-ˆØ ¨Ð7Ð7r$   c                óú  — | j                   j                  t        j                  k(  sJ d«       ‚| j                   j                  rt
        j                  nt
        j                  }|j                  d   }t        ||«      \  }}|€t        j                  d«       |gS t        j                  j                  |«      }t        |j                   «      }| j                   j"                  j%                  dd«      }	| j                   j&                  }
|	|k  r|	| k\  sJ d«       ‚|
dk\  r|
dz
  |
z  dk(  sJ d«       ‚|	|z   |z  }	| j)                  ||	|
| j                   j                  «      \  }}}|j                  D ].  }|j*                  |k(  sŒ|j                  j-                  |«        n t        j.                  j1                  |j*                  d	z   ||j                   |j3                  «       d
«      }t        j                  j5                  ||j*                  dz   «      }|j*                  |j                  d   |j*                  g}|j6                  j9                  ||g«       | j                   j                  st        j.                  j1                  |j*                  dz   ||j                   |j3                  «       d
«      }|j;                  |j*                  «       |j6                  j9                  |g«       	 t        j.                  j=                  |d«      }||	|
dœ}t        j.                  j@                  	 d||jB                  d   g|j*                  r|j*                  d	z   ndddœ|¤Ž}|gS # t>        $ r d}Y Œdw xY w)z,Quantize weight data of Gather node to int4.z0Gather only supports QOperator format currently.r   z4Gather doesn't have const weight. Skip quantization.r   r   z&Invalid quantize axis for Gather node.é   z#Invalid block size for Gather node.Ú_Q4Tr?  r@  rR   )Úgather_axisr8  rG   rD  rE  rF  )ÚGatherBlockQuantized)"r™   r   r   r3   rW   r   r  r  rV  rW  rT  rU  rX  rY  rZ  rÁ   r�   r   ÚgetrG   rF  r­   r_  rd  rÉ  r  r^  r`  ra  rÄ   Úget_node_attr_valuer¾   re  rc  )r!   rg  rh  r  Údata_argÚdata_tensorprotoÚdata_graphprotoÚdata_ndarrayÚ	data_rankr8  rG   Úquantized_datart  ru  rV  Úquantized_data_tensorprotoÚscales_tensorprotor|  Úzp_tensorprotorJ  r~  Úgather_q4_nodes                         r"   Úquantize_gatherz*DefaultWeightOnlyQuantizer.quantize_gather#  s5  € à�{‰{×'Ñ'¬;×+@Ñ+@Ò@ÐtÐBtÓtÐ@à$(§K¡K×$<Ò$<”× Ò Ä+×BSÑBSˆØ—:‘:˜a‘=ˆÜ,;¸HÀkÓ,RÑ)Ð˜/ØÐ#Ü�K‰KÐNÔOØ�6ˆMä×(Ñ(×1Ñ1Ð2BÓCˆÜ˜×*Ñ*Ó+ˆ	ØŸ™×.Ñ.×2Ñ2°8¸QÓ?ˆØ—[‘[×+Ñ+ˆ
à˜yÒ(¨]¸y¸jÒ-HÐrÐJrÓrÐHØ˜RÒ j°1¡n¸
Ñ%BÀaÒ%GÐoÐJoÓoÐHà&¨Ñ2°iÑ?ˆØ.2×.CÑ.CØ˜-¨°T·[±[×5MÑ5Mó/
Ñ+ˆ˜ ð %×*Ñ*ò 	ˆEØ�z‰z˜XÓ%Ø×%Ñ%×,Ñ,¨UÔ3Ùð	ô
 &*§[¡[×%<Ñ%<Ø×!Ñ! EÑ)¨5°,×2DÑ2DÀn×F\ÑF\ÓF^Ð`dó&
Ð"ô "×.Ñ.×9Ñ9¸&ÐBR×BWÑBWÐZcÑBcÓdÐØ1×6Ñ6¸¿
¹
À1¹ÐGY×G^ÑG^Ð_ˆØ×#Ñ#×*Ñ*Ð,FÐHZÐ+[Ô\Ø�{‰{×'Ò'Ü!Ÿ[™[×4Ñ4Ø ×%Ñ%¨Ñ6¸¸v¿|¹|È[×M`ÑM`ÓMbÐdhóˆNð ×Ñ˜~×2Ñ2Ô3Ø×'Ñ'×.Ñ.°Ð/?Ô@ð	ÜŸ+™+×9Ñ9¸$ÀÓGˆKð
 'Ø*Ø$ñ
ˆô Ÿ™×.Ñ.Ø"ð
àØ—[‘[ ‘^Ð$Ø&*§i¢i�—‘˜UÒ"°RØ"ñ
ð ñ
ˆð ÐÐøô% ò 	ØŠKð	ús   Ë5 M, Í,M:Í9M:c                óª  — t         j                  d|j                  › d�«       | j                  j                  }|j
                  dk(  rW|dk(  r?| j                  j                  t        j                  k(  rt         j                  d«       |gS | j                  ||«      }ny|j
                  dk(  rD| j                  j                  dk7  rt         j                  d«       |gS | j                  ||«      }n&t         j                  d	|j
                  › d
�«       |gS t         j                  d|j                  › d| j                  j                  › d�«       |S )r/  r0  r1  r   r  z>MatMul only supports QOperator format for 8 bits quantization.r   rM   z)Gather only supports 4 bits quantization.zUnsupported operator z1 for weight only quantization. Skip quantization.rP  z with z	 bits ...)rT  rU  r­   r™   rQ   rS  r   r   rz   Úerrorr"  rX  )r!   rg  rh  rQ   Úresultss        r"   r…  z#DefaultWeightOnlyQuantizer.quantizec  s  € ô 	�‰Ð(¨¯©¨°4Ð8Ô9à�{‰{×ÑˆØ�<‰<˜8Ò#Ø�qŠy˜TŸ[™[×5Ñ5¼¿¹ÒHÜ—‘Ð]Ô^Ø�v�Ø×*Ñ*¨4°Ó=‰GØ�\‰\˜XÒ%Ø�{‰{×Ñ 1Ò$Ü—‘ÐHÔIØ�v�à×*Ñ*¨4°Ó=‰Gä�L‰LÐ0°·±°Ð>oÐpÔqØ�6ˆMä�‰Ð/°·	±	¨{¸&ÀÇÁ×AQÑAQÐ@RÐR[Ð\Ô]Øˆr$   N)r™   rT   )ró  znpt.ArrayLiker‰  ú)tuple[np.ndarray, np.ndarray, np.ndarray]r‡  )rÕ   ú
np.ndarrayr‰  ztuple[np.ndarray, np.ndarray])rÕ   r]  r‰  r\  )rÕ   r]  r‰  r]  )
rÕ   r]  r8  r[   rG   r[   rW   r\   r‰  z0tuple[np.ndarray, np.ndarray, np.ndarray | None])r)   r*   r+   r#   rø  r"  r‹  r.  r2  r6  rF  rX  r…  r,   r$   r"   rð  rð  Ü  sž   „ óó0,ódwðr ò&ó ð&ð ò2ó ð2ð ò/ó ð/ð ð58Øð58àð58ð ð58ð ð	58ð
 
:ò58ó ð58ón> ô@r$   rð  c                  ó    — e Zd Z	 	 dd„Zdd„Zy)ÚNVAWQWeightOnlyQuantizerc                ó   — || _         y rÝ   ræ   rç   s     r"   r#   z!NVAWQWeightOnlyQuantizer.__init__†  rè   r$   c                ó  — 	 ddl m} t        j                  d«       | j                  j                  } ||| j                  j                  |¬«      }t        j                  d«       |S # t        $ r t        d«       t        d«      d‚w xY w)	zé
        Perform nvidia_awq quantization using ModelOpt's int4 quantize function.

        Args:
            model (ModelProto): The ONNX model to quantize.

        Returns:
            ModelProto: The quantized ONNX model.
        r   )r…  zlPlease ensure that the 'modelopt' package is installed. Please install it using pip install nvidia_modelopt.zXmodelopt is not installed. Please install it using pip install nvidia_modelopt. Exiting.Nz#Starting nvidia_awq quantization...)r}   rE   ú"Completed nvidia_awq quantization.)	Úmodelopt.onnx.quantization.int4r…  rv   rw   rT  rU  r™   rE   r}   )r!   ÚmodelÚquantize_int4r   Úquantized_models        r"   Úquantize_awqz%NVAWQWeightOnlyQuantizer.quantize_awqŒ  s�   € ð	ÝQô 	�‰Ð9Ô:ð —{‘{×:Ñ:ˆñ (ØØ#Ÿ{™{×=Ñ=Ø$0ô
ˆô 	�‰Ð8Ô9ØÐøô+ ò 	ÜØ~ôô Øjóàðð		ús   ‚A) Á)!B
N)r™   r_   )rd  úModelProto | strr‰  r   )r)   r*   r+   r#   rg  r,   r$   r"   r_  r_  …  s   „ ðà*óô!r$   r_  c                  ó„   — e Zd ZdZddddddej
                  ddddf	 	 	 	 	 	 	 	 	 	 	 	 	 	 	 	 	 	 	 dd„Zdd„Zd„ Zd	„ Z	d
„ Z
y)ÚMatMulNBitsQuantizera¼  
    Target node:        QOperator node:            QDQ nodes:
    MatMul              MatMulNBits                DeQuantizeLinear -> MatMul
    Gather              GatherBlockQuantized       Gather, Gather, Gather (optional) -> DequantizeLinear

    Perform 2/4/8 bits quantization of constant weights for target nodes.
    If algo_config.quant_format is QOperator:
      - nodes are replaced by the corresponding QOperator nodes.
      - quantized weights are stored in the contrib ops.
    If algo_config.quant_format is QDQ:
      - the quantized weight is stored in a standard onnx node. For MatMul, it is DequantizeLinear. For Gather,
        it is the three Gathers, one for quantized data, one for scales and one for optional zero points.
      - The nodes are replaced by the corresponding QDQ nodes.
      - currently Gather is not supported in QDQ because Gather does not support int4 yet.
    Note:
      - for quantized gather, the memory usage of "DequantizeLinear + Gather" is the same as the original Gather
        during runtime. Therefor it is not recommended.
      - when a node is in nodes_to_exclude, and the node configuration in algo_config.customized_weight_config will be ignored.
    rM   rB   FNc           
     óæ  — |€g }t        |t        «      rt        t        j                  |«      «      n
t        |«      | _        t        |t        «      r|nd | _        || _        || _        || _	        || _
        t        |«      | _        |rt        |«      nd | _        d | _        |€t        |||||	|
||¬«      }|| _        t#        | j                   d«      r| j                   j                  dv sJ d«       ‚|j$                  dk(  rt'        | j                   «      | _        y |j$                  dk(  rt)        | j                   «      | _        y |j$                  dk(  rt+        | j                   «      | _        y y )N)rG   rW   rX   r   r   r   rQ   rY   rQ   r  z(Only support 2, 4 or 8 bits quantizationrO   rV   re   )r†   r%   r   rX  Úloadrd  Ú
model_pathrQ   rG   rW   rX   r   Únodes_to_excludeÚnodes_to_includeÚnode_quantizerrT   Úalgo_configÚhasattrr   rä   rð  r_  )r!   rd  rQ   rG   rW   rX   rn  ro  r   r   r   rY   rq  s                r"   r#   zMatMulNBitsQuantizer.__init__Å  sY  € ð Ð#Ø!ÐÜ4>¸uÄcÔ4J”YœtŸy™y¨Ó/Ô0ÔPYÐZ_ÓP`ˆŒ
Ü#-¨e´SÔ#9™%¸tˆŒØˆŒ	Ø$ˆŒØ(ˆÔØ,ˆÔÜ #Ð$4Ó 5ˆÔÙ9I¤Ð$4Ô 5ÈtˆÔØ"ˆÔàÐÜ6Ø%Ø)Ø-Ø)Ø%9Ø%ØØ'=ô	ˆKð 'ˆÔÜ�4×#Ñ# VÔ,Ø×#Ñ#×(Ñ(¨IÑ5ÐaÐ7aÓaÐ5à× Ñ  EÒ)Ü"8¸×9IÑ9IÓ"JˆDÕØ×"Ñ" iÒ/Ü"<¸T×=MÑ=MÓ"NˆDÕØ×"Ñ" lÒ2Ü":¸4×;KÑ;KÓ"LˆDÕð 3r$   c                óò  — g }|d   }|j                   D �]ž  }|j                  D �cg c]R  }|j                  t        j                  j
                  k(  s'|j                  t        j                  j                  k(  r|‘ŒT }}|�rVi }|j                  D ]ù  }|j                  t        j                  j
                  k(  r9|j                  |j                  «       |j                  | j                  |«      i}n†|j                  t        j                  j                  k(  rTg }	|j                  D ]4  }
|j                  |
«       |	j                  | j                  |«      g«       Œ6 |j                  |	i}nt        |«      }|j                  |«       Œû t        j                  j                   |j"                  |j$                  |j&                  fd|j                  i|¤Ž}g }|j                  | j(                  v r't*        j-                  d|j                  › d�«       |g}n‰| j.                  r|j                  | j.                  v s"|j"                  | j0                  j2                  v r| j4                  j7                  ||«      }n&t*        j-                  d|j                  › d�«       |g}|j                  |«       �Œ¡ |j9                  d«       |j                   j                  |«       |j;                  «        |S c c}w )Nr„   r­   zexclude to quantize z$ as specified by nodes_to_exclude...zskip to quantize r1  rg  )rg  Ú	attributer’  rX  ÚAttributeProtoÚGRAPHÚGRAPHSrÄ   Úgr­   Ú_process_subgraphÚgraphsra  r   r˜   rd  re  rS  rV  rc  rn  rT  rU  ro  rq  r   rp  r…  Ú
ClearFieldÚpop)r!   rh  Ú	new_nodesr�  rg  ÚattrÚgraph_attrsr~  ÚkvrÀ  ÚsubgraphÚ	out_nodess               r"   ry  z&MatMulNBitsQuantizer._process_subgraph÷  s  € Øˆ	Ø˜B‘ˆà—J‘Jó %	(ˆDð !ŸN™NöàØ—9‘9¤× 3Ñ 3× 9Ñ 9Ò9¸T¿Y¹YÌ$×J]ÑJ]×JdÑJdÒ=dò ðˆKð ò
 Ø�Ø ŸN™Nò &�DØ—y‘y¤D×$7Ñ$7×$=Ñ$=Ò=à#×*Ñ*¨4¯6©6Ô2Ø"Ÿi™i¨×)?Ñ)?ÀÓ)LÐM™ØŸ™¤d×&9Ñ&9×&@Ñ&@Ò@Ø "˜Ø(,¯©ò P˜Hà'×.Ñ.¨xÔ8Ø!ŸL™L¨$×*@Ñ*@ÀÓ*MÐ)NÕOðPð #Ÿi™i¨Ð/™ä/°Ó5˜Ø—M‘M "Õ%ð&ô —{‘{×,Ñ,Ø—L‘L $§*¡*¨d¯k©kñØ@DÇ	Á	ðØMSñ�ð ˆIØ�y‰y˜D×1Ñ1Ñ1Ü—‘Ð2°4·9±9°+Ð=aÐbÔcØ!˜F‘	Ø×'Ò'¨D¯I©I¸×9NÑ9NÑ,NØ—‘ × 0Ñ 0× EÑ EÑEà ×/Ñ/×8Ñ8¸¸{ÓK‘	ä—‘Ð/°·	±	¨{¸$Ð?Ô@Ø!˜F�	Ø×Ñ˜YÖ'ðK%	(ðN 	×Ñ˜Ô Ø�
‰
×Ñ˜)Ô$Ø�‰ÔØˆùòSs   ¦AK4c                ó  ‡ — i }‰ j                   j                   j                  j                  D ]Ø  }|j                  dv sŒt	        ˆ fd„|j
                  D «       «      rŒ1d‰ j                  ‰ j                  rdnddœ}‰ j                  j                  re|j                  ‰ j                  j                  v rC‰ j                  j                  |j                     j                  «       D ]  \  }}||v sŒ|||<   Œ |||j                  <   ŒÚ |S )z3Generate weight only quant configuration for nodes.©r   c              3  óX   •K  — | ]!  }‰j                   j                  |«      d u –— Œ# y ­wrÝ   )rd  rW  )r8  r¢   r!   s     €r"   r:  z@MatMulNBitsQuantizer._generate_q4_node_config.<locals>.<genexpr>,  s%   øè ø€ ÒUÀQ˜4Ÿ:™:×5Ñ5°aÓ8¸DÔ@ÑUùs   ƒ'*rM   ÚsymÚasym)rQ   r"  Úscheme)rd  r�  rg  rS  ÚallrV  rG   rW   rq  r    r­   rÅ   )r!   Úq4_node_configrg  Útemplate_config_q4ÚkeyrÀ  s   `     r"   Ú_generate_q4_node_configz-MatMulNBitsQuantizer._generate_q4_node_config'  sø   ø€ àˆØ—J‘J×$Ñ$×*Ñ*×/Ñ/ò 	CˆDØ�|‰|˜zÒ)ÜÓUÈ$Ï*É*ÔUÕUà !Ø&*§o¡oØ+/×+<Ò+<¡%À&ñ*Ð&ð ×(Ñ(×AÒAØ ŸI™I¨×)9Ñ)9×)RÑ)RÑRà*.×*:Ñ*:×*SÑ*SÐTX×T]ÑT]Ñ*^×*dÑ*dÓ*fò @™J˜C Ø"Ð&8Ò8Ø:?Ð 2°3Ò 7ð@ð 1C�N 4§9¡9Ò-ð	Cð  Ðr$   c                óˆ  ‡ — ˆ fd„}i }‰ j                   �‰ j                   |d<   ‰ j                  «       }‰ j                  j                  }t        j                  d|› d�«       |dv ru‰ j                  j                  |d<   ||d<   	 ‰ j                  D ]  }d	||<   Œ	 t        d‰ j                  �‰ j                  n‰ j                  j                  |d
œ|¤Ž‰ _
        nÎ|dk(  rÉ‰ j                  j                  |d<   ‰ j                  j                  |d<   ‰ j                  j                  |d<   ‰ j                  j                  |d<   ‰ j                  j                  |d<   d|d<    |«       }t!        d‰ j                  �‰ j                  n‰ j                  j                  ||dœ|¤Ž‰ _
        t        j                  d|› d�«       y)u  4b quantize a model with RTN or GPTQ algorithm. Please refer to
        https://github.com/intel/neural-compressor/blob/master/docs/source/quantization_weight_only.md
        for more details on weight only quantization using IntelÂ® Neural Compressor.
        c               3  óz   •K  — t        j                  ‰j                  j                  «      } | D ]  }|d f–— Œ
 y ­wrÝ   )ÚcopyÚdeepcopyrq  rE   )Údata_readerrÕ   r!   s     €r"   Úinc_dataloaderz<MatMulNBitsQuantizer.int4_quant_algo.<locals>.inc_dataloaderB  s:   øè ø€ ÜŸ-™-¨×(8Ñ(8×(PÑ(PÓQˆKØ#ò !�Ø˜D�jÓ ñ!ùs   ƒ8;NrX   zstart to quantize model with z algorithm...)r0   r?   r5   r   Úfp32)rd  Úweight_configrD   rF   Ú	blocksizerH   rI   rJ   r„   Ú	n_samples)rd  r•  Ú
dataloaderz$complete quantization of model with z algorithm.r,   )rX   r�  rq  r   rT  rU  r5   rn  r   rm  rd  rF   rG   rH   rI   rJ   r   )r!   r“  r~  Úweight_only_node_configr   r;  r˜  s   `      r"   Úint4_quant_algoz$MatMulNBitsQuantizer.int4_quant_algo<  sÌ  ø€ ô	!ð
 ˆØ×ÑÐ*Ø'+×':Ñ':ˆFÐ#Ñ$Ø"&×"?Ñ"?Ó"AÐà×$Ñ$×.Ñ.ˆ	Ü�‰Ð3°I°;¸mÐLÔMØÐ*Ñ*Ø#×/Ñ/×6Ñ6ˆF�8ÑØ"+ˆF�;Ñðð ×*Ñ*ò 4�Ø-3Ð'¨Ò*ð4ô &ð Ø)-¯©Ð)D�d—o’oÈ$Ï*É*×JZÑJZØ5ñð ñˆD�Jð
 ˜&Ò Ø!%×!1Ñ!1×!:Ñ!:ˆF�:ÑØ"&×"2Ñ"2×"=Ñ"=ˆF�;ÑØ!%×!1Ñ!1×!:Ñ!:ˆF�:ÑØ ×,Ñ,×0Ñ0ˆF�5‰MØ#'×#3Ñ#3×#>Ñ#>ˆF�<Ñ Ø"$ˆF�;ÑÙ'Ó)ˆJä&ð Ø)-¯©Ð)D�d—o’oÈ$Ï*É*×JZÑJZØ5Ø%ñð ñ	ˆDŒJô 	�‰Ð:¸9¸+À[ÐQÕRr$   c                óf  — | j                   j                  dv �rD| j                  j                  «       g}| j                   j                  t
        j                  k(  r| j                  j                  dd«       | j                   j                  t
        j                  k(  sd| j                   j                  v r{| j                  j                  «       }|D ]\  }|j                  dv sŒ|j                  dk  sŒ"t        j                  d«       | j                  j                  |j                  d«       Œ^ | j                  |«       | j                  j!                  «        y | j                   j                  dk(  r«t        j#                  d	«       | j$                  j'                  | j(                  €| j                  j                  n| j(                  «      | _        t        j#                  d
«       t+        | j                  «      | _        | j                  j!                  «        y | j-                  «        y )N)rO   rV   rE  r   r   )Nzai.onnxrD  é   zžThe opset of the input model is under 21 and doesn't support int4 data type. Force to update it to opset 21, but the generated model may not be a valid model.re   z%Processing nvidia_awq quantization...rb  )rq  r   rd  r�  r   r   r3   Úset_opset_importrz   r   Úopset_importrH  ÚversionrT  Úwarningry  Úclean_initializersrU  rp  rg  rm  r   rš  )r!   rh  rž  Úopsets       r"   ÚprocesszMatMulNBitsQuantizer.processn  s¡  € Ø×Ñ×%Ñ%Ð);Ò;àŸ:™:×+Ñ+Ó-Ð.ˆKð ×Ñ×,Ñ,´×0EÑ0EÒEØ—
‘
×+Ñ+¨O¸QÔ?à×Ñ×,Ñ,´·±Ò?À8Èt×O_ÑO_×OtÑOtÑCtØ#Ÿz™z×6Ñ6Ó8�Ø)ò F�EØ—|‘|Ð'<Ò<ÀÇÁÐQSÓASÜŸ™ðpôð Ÿ
™
×3Ñ3°E·L±LÀ"ÕEðFð ×"Ñ" ;Ô/Ø�J‰J×)Ñ)Õ+Ø×Ñ×'Ñ'¨<Ò7ä�K‰KÐ?Ô@Ø×,Ñ,×9Ñ9Ø$(§O¡OÐ$;�—
‘
× Ò ÀÇÁóˆDŒJô �K‰KÐ<Ô=Ü" 4§:¡:Ó.ˆDŒJØ�J‰J×)Ñ)Õ+ð × Ñ Õ"r$   )rd  rh  rQ   r[   rG   r[   rW   r\   rX   r]   ro  zlist[str] | Noner   r&   r   r'   rY   r\   rq  zWeightOnlyQuantConfig | None)rh  rˆ  )r)   r*   r+   Ú__doc__r   r3   r#   ry  r�  rš  r£  r,   r$   r"   rj  rj  °  sº   „ ñð. ØØ"Ø%)ØØ-1Ø ×*Ñ*Ø7;Ø9=Ø',Ø48ð0Màð0Mð ð0Mð ð	0Mð
 ð0Mð #ð0Mð +ð0Mð 5ð0Mð 7ð0Mð !%ð0Mð 2ó0Mód.ò`ò*0Sód #r$   rj  c                ó&   — | j                  «       dv S )N)ÚtrueÚ1)Úlower)rÀ  s    r"   Úort_convert_str_to_boolr©  ‘  s   € Ø�;‰;‹=˜MÐ)Ð)r$   c                óD   — | j                  d«      \  }}|t        |«      fS )Nú:)r®   r[   )ÚsrŒ  rÀ  s      r"   Úparse_key_value_pairr­  –  s!   € Ø—‘˜“�J€CˆØ”�E“
ˆ?Ðr$   c            
     óú  — t        j                  d¬«      } | j                  ddd¬«       | j                  ddd¬«       | j                  d	d
dt        d¬«       | j                  ddt        g d¢d¬«       | j                  ddt        d¬«       | j                  dd
dddt
        dd
gd¬«       | j                  dd
t        d¬«       | j                  ddd
d ¬!«       | j                  d
¬"«       | j                  d#d$t        d
g d%¬&«       | j                  d'd$t        d
d(¬)«       | j                  d*d+t        d+d,gd-¬«       | j                  d.t        d$d/d0gd1¬2«       | j                  d3t        d$d
d4¬5«       | j                  d6d7«      }|j                  d8t        d9d:¬;«       |j                  d<t        d
d=¬>«       |j                  d?t        d
d@dAgdB¬C«       |j                  dDt        dEdF¬;«       | j                  «       S )GNa
  Blockwise int4 quantization for MatMul 2D weight matrices.

A weight matrix is partitioned into into blocks, where each block is a
continguous subset inside each column. Each block is quantized into a
set of 4b integers with a scaling factor and an optional offset.
)Údescriptionz--input_modelTzPath to the input model file)ÚrequiredÚhelpz--output_modelzPath to the output model filez--block_sizeFrh   zBlock size for quantization)r°  Údefaultr’  r±  z--quant_methodr²  )r²  ÚhqqÚrtnr?   Úgptqre   uW   the algorithm used to quantize weight, 
rtn and gptq leverage IntelÂ® Neural Compressor)r²  r’  Úchoicesr±  z--bitsrM   z#the target bits to represent weight)r²  r’  r±  z--symmetricú?zWIndicate whether to quantize the model symmetrically, symmetric is not supported by hqq)r°  r²  ÚconstÚnargsr’  r¶  r±  z--accuracy_levelzíAccuracy level of the 4-bit quantized MatMul computation. Refer to the MatMulNBits contrib op's 'accuracy_level' attribute for details (https://github.com/microsoft/onnxruntime/blob/main/docs/ContribOperators.md#commicrosoftmatmulnbits).)r°  r’  r±  z-vz	--verboseÚ
store_true)r°  Úaction)r  z--nodes_to_excludeú+zBSpecify the nodes to be excluded from quantization with node names)r¹  r’  r°  r²  r±  z--nodes_to_includezKSpecify the specific nodes to be included from quantization with node names)r¹  r’  r°  r±  z--quant_formatr3   rz   z±QuantFormat {QOperator, QDQ}QOperator format quantizes the model with quantized operators directly.QDQ format quantize the model by inserting DeQuantizeLinear before the MatMul.z--op_types_to_quantizer   r   zPop_types_to_quantize {MatMul, Gather}. Operators to quantize. Default is MatMul.)r’  r¹  r¶  r±  z--quant_axeszªKey-value pairs in op_type:axis_to_quantize separated by space.Specify the axis to quantize for an op. Default {MatMul:0, Gather:1}Example: --quant_axes MatMul:0 Gather:1)r’  r¹  r°  r±  re   z-Arguments specific to nvidia_awq quantizationz--calib_dataset_namerª   z/Name of the calibration dataset for nvidia_awq.)r’  r²  r±  z--tokenizer_dirzPath of the tokenizer dir.)r’  r°  r±  z--calibration_methodÚawqÚawq_clipz<Support two options, awq implementation and weight clipping.)r’  r°  r¶  r±  z--cache_dirrÚ   z%Cache directory for calibration data.)
ÚargparseÚArgumentParserÚadd_argumentr[   r%   r©  Úset_defaultsr­  Úadd_argument_groupÚ
parse_args)ÚparserÚnv_awq_configs     r"   rÄ  rÄ  ›  s�  € Ü×$Ñ$ðô€Fð ×Ñ˜°$Ð=[ÐÔ\Ø
×ÑÐ(°4Ð>]ÐÔ^Ø
×Ñ˜°ÀÌÐSpÐÔqØ
×ÑØØÜÚJØgð ô ð ×Ñ˜¨!´#Ð<aÐÔbØ
×ÑØØØØØÜ$Ø�u�Øfð ô 	ð ×ÑØØÜðqð	 ô ð ×Ñ˜˜k°EÀ,ÐÔOØ
×Ñ ÐÔ&Ø
×ÑØØÜØØØQð ô ð ×ÑØØÜØØZð ô ð ×ÑØØÜØ˜eÐ$ðYð ô ð ×ÑØ ÜØØ˜8Ð$Ø_ð ô ð ×ÑØÜ!ØØð2ð ô ð ×-Ñ-¨lÐ<kÓl€MØ×ÑØÜØØ>ð	 ô ð ×ÑØÜØØ)ð	 ô ð ×ÑØÜØØ˜
Ð#ØKð ô ð ×ÑØÜØØ4ð	 ô ð ×ÑÓÐr$   Ú__main__r„  zfile z already existsr³  zAsymmetric is not supportted by hqq, will force to symmetric=FalseF)rG   rQ   r   r   r²  )rG   rW   rX   r   r   r   rQ   r´  )r   r?   rµ  )rG   r   re   zFQOperator is not applicable to nvidia_awq. overriding the value to QDQr½  rÛ   r¾  )ri   r~   rk   r}   z!Unsupported quantization method: )rd  rQ   rX   rn  ro  rq  T)r�  rˆ  r‰  ztuple[TensorProto, GraphProto])r–  r%   r�  rˆ  r‰  r]   )rJ  r%   rK  ÚtuplerL  r   rM  r%   rN  r%   rO  r%   r‰  rŠ  )`Ú
__future__r   r¿  r�  ÚloggingÚosr  rÆ   rÞ   Únumpy.typingÚtypingÚnptrX  Úonnx_irr	  Úonnx.onnx_pbr   r   r   r   Úonnxruntime.capi._pybind_stater   r	   r
   r   Ú	calibrater   Úneural_compressorr   r   Ú
onnx_modelr   Úquant_utilsr   r   ÚbasicConfigÚINFOÚ	getLoggerr)   rT  r   r.   r=   rA   rL   rT   r_   râ   rä   rW  rb  rf  rî  rð  r_  rj  r©  r­  rÄ  Úargsr  ÚsetLevelÚDEBUGÚinput_modelÚinput_model_pathÚoutput_modelÚoutput_model_pathr   r   rÈ  r   ÚpathÚexistsrZ  Ú	ExceptionÚ	symmetricÚquant_methodr   rl  rd  rG   rQ   Úquant_configrX   r3   rz   r}   Úcalib_dataset_namer~   rk   r¾   rn  ro  Úquantr£  Úsave_model_to_filer,   r$   r"   ú<module>ré     s0  ðõ #ã Û Û Û 	ã Û Ý Û Û ß GÓ G÷ó õ -ß :Ý !ß 8à €× Ñ ÐOÐW^×WcÑWcÕ dØ	ˆ×	Ñ	˜8Ó	$€÷Añ Aô@#Ð4ô #ôLÐ"7ô ôD0%Ð 5ô 0%ôf(Ð4ô (ôV/kÐ#8ô /kôds#Ð!6ô s#òl4÷Pñ Pófóð&Øðàðð ðð ð	ð
 ðð ðð óòF#÷&fñ f÷R(ñ (÷V^#ñ ^#òB*ò
ò
lð^ ˆzÓÙ‹<€DØ‡|‚|Ø�‰˜Ÿ™Ô&à×'Ñ'ÐØ×)Ñ)ÐØ˜t×0Ñ0Ñ1€LØ?C×?XÒ?X™5 ×!:Ñ!:Ô;Ð^iÐØ+/¯?ª?‘�t—‘Ô'À€Jà	‡w�w‡~�~Ð'Ô(Ø�‰�uÐ.Ð/¨Ð?Ô@Ù˜%Ð 1Ð2°/ÐBÓCÐCà‡~‚~˜$×+Ñ+¨uÒ4Ø�‰ÐZÔ[ØˆŒàˆD�I‰IÐ&Ó'€EØ×Ñ˜EÒ!Ù/Ø—‘¨T¯Y©YÐMaÐnxô
Šð 
×	Ñ	˜iÒ	'Ù3Ø—‘ØŸ™Ø×.Ñ.Ø%Ø!5Ø!Ø—‘ô
‰ð 
×	Ñ	˜eÒ	#Ù/ÐEYÔZ‰Ø	×	Ñ	˜iÒ	'Ù2ÐH\Ô]‰Ø	×	Ñ	˜fÒ	$Ù0¸D¿O¹OÐbvÔw‰Ø	×	Ñ	˜lÒ	*Ø˜;×0Ñ0Ò0Ø�N‰NÐcÔdØ&Ÿ?™?ˆLà ˆØ×"Ñ"Ð.Ø×&Ñ&¨%Ò/Ø%/Ñ"à%/Ñ"à!+Ðá1Ø×0Ñ0Ø×,Ñ,Ø—n‘nØ1ô	
‰ñ Ð<¸T×=NÑ=NÐ<OÐPÓQÐQá ØØ�Y‰YØ×*Ñ*Ø×.Ñ.Ø×.Ñ.Ø ô€Eð 
‡M�M„OØ	‡K�K×"Ñ"Ð#4°dÕ;ðQ r$   