o
    <Æ&iK  ã                   @   s„  d dl Z d dlZd dlZd dlmZmZmZmZmZm	Z	m
Z
mZmZ d dlmZmZ d dlmZ ddlmZmZ g d¢Ze
dd	d
Ze
dƒZeeef Ze	edf Ze
deeƒZG dd„ dee ƒZG dd„ dee ee ƒZG dd„ dee	edf  ƒZG dd„ dee ƒZG dd„ dee ƒZ G dd„ deƒZ!G dd„ dee ƒZ"efdee deee#e$f  dee dee"e  fd d!„Z%dS )"é    N)	ÚGenericÚIterableÚListÚOptionalÚSequenceÚTupleÚTypeVarÚUnionÚDict)Údefault_generatorÚrandperm)Ú_accumulateé   )Ú	GeneratorÚTensor)ÚDatasetÚIterableDatasetÚTensorDatasetÚStackDatasetÚConcatDatasetÚChainDatasetÚSubsetÚrandom_splitÚT_coT)Ú	covariantÚT.ÚT_stackc                   @   s(   e Zd ZdZdefdd„Zddd	„Zd
S )r   aµ  An abstract class representing a :class:`Dataset`.

    All datasets that represent a map from keys to data samples should subclass
    it. All subclasses should overwrite :meth:`__getitem__`, supporting fetching a
    data sample for a given key. Subclasses could also optionally overwrite
    :meth:`__len__`, which is expected to return the size of the dataset by many
    :class:`~torch.utils.data.Sampler` implementations and the default options
    of :class:`~torch.utils.data.DataLoader`. Subclasses could also
    optionally implement :meth:`__getitems__`, for speedup batched samples
    loading. This method accepts list of indices of samples of batch and returns
    list of samples.

    .. note::
      :class:`~torch.utils.data.DataLoader` by default constructs an index
      sampler that yields integral indices.  To make it work with a map-style
      dataset with non-integral indices/keys, a custom sampler must be provided.
    Úreturnc                 C   s   t dƒ‚)Nz3Subclasses of Dataset should implement __getitem__.)ÚNotImplementedError©ÚselfÚindex© r"   úCC:\wamp64\www\opt\env\Lib\site-packages\torch/utils/data/dataset.pyÚ__getitem__;   s   zDataset.__getitem__ÚotherúDataset[T_co]úConcatDataset[T_co]c                 C   ó   t | |gƒS ©N)r   ©r    r%   r"   r"   r#   Ú__add__B   ó   zDataset.__add__N)r%   r&   r   r'   )Ú__name__Ú
__module__Ú__qualname__Ú__doc__r   r$   r+   r"   r"   r"   r#   r   (   s    r   c                   @   s"   e Zd ZdZdee fdd„ZdS )r   aH  An iterable Dataset.

    All datasets that represent an iterable of data samples should subclass it.
    Such form of datasets is particularly useful when data come from a stream.

    All subclasses should overwrite :meth:`__iter__`, which would return an
    iterator of samples in this dataset.

    When a subclass is used with :class:`~torch.utils.data.DataLoader`, each
    item in the dataset will be yielded from the :class:`~torch.utils.data.DataLoader`
    iterator. When :attr:`num_workers > 0`, each worker process will have a
    different copy of the dataset object, so it is often desired to configure
    each copy independently to avoid having duplicate data returned from the
    workers. :func:`~torch.utils.data.get_worker_info`, when called in a worker
    process, returns information about the worker. It can be used in either the
    dataset's :meth:`__iter__` method or the :class:`~torch.utils.data.DataLoader` 's
    :attr:`worker_init_fn` option to modify each copy's behavior.

    Example 1: splitting workload across all workers in :meth:`__iter__`::

        >>> # xdoctest: +REQUIRES(env:TORCH_DOCTEST_DATALOADER)
        >>> # xdoctest: +SKIP("Fails on MacOS12")
        >>> class MyIterableDataset(torch.utils.data.IterableDataset):
        ...     def __init__(self, start, end):
        ...         super(MyIterableDataset).__init__()
        ...         assert end > start, "this example code only works with end >= start"
        ...         self.start = start
        ...         self.end = end
        ...
        ...     def __iter__(self):
        ...         worker_info = torch.utils.data.get_worker_info()
        ...         if worker_info is None:  # single-process data loading, return the full iterator
        ...             iter_start = self.start
        ...             iter_end = self.end
        ...         else:  # in a worker process
        ...             # split workload
        ...             per_worker = int(math.ceil((self.end - self.start) / float(worker_info.num_workers)))
        ...             worker_id = worker_info.id
        ...             iter_start = self.start + worker_id * per_worker
        ...             iter_end = min(iter_start + per_worker, self.end)
        ...         return iter(range(iter_start, iter_end))
        ...
        >>> # should give same set of data as range(3, 7), i.e., [3, 4, 5, 6].
        >>> ds = MyIterableDataset(start=3, end=7)

        >>> # Single-process loading
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=0)))
        [tensor([3]), tensor([4]), tensor([5]), tensor([6])]

        >>> # xdoctest: +REQUIRES(POSIX)
        >>> # Mult-process loading with two worker processes
        >>> # Worker 0 fetched [3, 4].  Worker 1 fetched [5, 6].
        >>> # xdoctest: +IGNORE_WANT("non deterministic")
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=2)))
        [tensor([3]), tensor([5]), tensor([4]), tensor([6])]

        >>> # With even more workers
        >>> # xdoctest: +IGNORE_WANT("non deterministic")
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=12)))
        [tensor([3]), tensor([5]), tensor([4]), tensor([6])]

    Example 2: splitting workload across all workers using :attr:`worker_init_fn`::

        >>> # xdoctest: +REQUIRES(env:TORCH_DOCTEST_DATALOADER)
        >>> class MyIterableDataset(torch.utils.data.IterableDataset):
        ...     def __init__(self, start, end):
        ...         super(MyIterableDataset).__init__()
        ...         assert end > start, "this example code only works with end >= start"
        ...         self.start = start
        ...         self.end = end
        ...
        ...     def __iter__(self):
        ...         return iter(range(self.start, self.end))
        ...
        >>> # should give same set of data as range(3, 7), i.e., [3, 4, 5, 6].
        >>> ds = MyIterableDataset(start=3, end=7)

        >>> # Single-process loading
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=0)))
        [3, 4, 5, 6]
        >>>
        >>> # Directly doing multi-process loading yields duplicate data
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=2)))
        [3, 3, 4, 4, 5, 5, 6, 6]

        >>> # Define a `worker_init_fn` that configures each dataset copy differently
        >>> def worker_init_fn(worker_id):
        ...     worker_info = torch.utils.data.get_worker_info()
        ...     dataset = worker_info.dataset  # the dataset copy in this worker process
        ...     overall_start = dataset.start
        ...     overall_end = dataset.end
        ...     # configure the dataset to only process the split workload
        ...     per_worker = int(math.ceil((overall_end - overall_start) / float(worker_info.num_workers)))
        ...     worker_id = worker_info.id
        ...     dataset.start = overall_start + worker_id * per_worker
        ...     dataset.end = min(dataset.start + per_worker, overall_end)
        ...

        >>> # Mult-process loading with the custom `worker_init_fn`
        >>> # Worker 0 fetched [3, 4].  Worker 1 fetched [5, 6].
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=2, worker_init_fn=worker_init_fn)))
        [3, 5, 4, 6]

        >>> # With even more workers
        >>> print(list(torch.utils.data.DataLoader(ds, num_workers=12, worker_init_fn=worker_init_fn)))
        [3, 4, 5, 6]
    r%   c                 C   r(   r)   )r   r*   r"   r"   r#   r+   ·   r,   zIterableDataset.__add__N)r-   r.   r/   r0   r   r   r+   r"   r"   r"   r#   r   J   s    lr   c                   @   sD   e Zd ZU dZeedf ed< deddfdd„Zdd	„ Zd
d„ Z	dS )r   zÎDataset wrapping tensors.

    Each sample will be retrieved by indexing tensors along the first dimension.

    Args:
        *tensors (Tensor): tensors that have the same size of the first dimension.
    .Útensorsr   Nc                    s(   t ‡ fdd„ˆ D ƒƒsJ dƒ‚ˆ | _d S )Nc                 3   s(    | ]}ˆ d    d ¡|  d ¡kV  qdS )r   N)Úsize©Ú.0Ztensor©r1   r"   r#   Ú	<genexpr>Ê   s   €& z)TensorDataset.__init__.<locals>.<genexpr>zSize mismatch between tensors)Úallr1   )r    r1   r"   r5   r#   Ú__init__É   s   
zTensorDataset.__init__c                    s   t ‡ fdd„| jD ƒƒS )Nc                 3   ó    | ]}|ˆ  V  qd S r)   r"   r3   ©r!   r"   r#   r6   Î   ó   € z,TensorDataset.__getitem__.<locals>.<genexpr>)Útupler1   r   r"   r:   r#   r$   Í   s   zTensorDataset.__getitem__c                 C   s   | j d  d¡S ©Nr   )r1   r2   ©r    r"   r"   r#   Ú__len__Ð   s   zTensorDataset.__len__)
r-   r.   r/   r0   r   r   Ú__annotations__r8   r$   r?   r"   r"   r"   r#   r   ¾   s   
 r   c                   @   s^   e Zd ZU dZeeef ed< dee	 dee	 ddfdd„Z
d	d
„ Zdefdd„Zdd„ ZdS )r   a  Dataset as a stacking of multiple datasets.

    This class is useful to assemble different parts of complex input data, given as datasets.

    Example:
        >>> # xdoctest: +SKIP
        >>> images = ImageDataset()
        >>> texts = TextDataset()
        >>> tuple_stack = StackDataset(images, texts)
        >>> tuple_stack[0] == (images[0], texts[0])
        >>> dict_stack = StackDataset(image=images, text=texts)
        >>> dict_stack[0] == {'image': images[0], 'text': texts[0]}

    Args:
        *args (Dataset): Datasets for stacking returned as tuple.
        **kwargs (Dataset): Datasets for stacking returned as dict.
    ÚdatasetsÚargsÚkwargsr   Nc                    s”   |r#|rt dƒ‚t|d ƒˆ _t‡ fdd„|D ƒƒrt dƒ‚|ˆ _d S |rFt| ¡ ƒ}t|d ƒˆ _t‡ fdd„|D ƒƒrAt dƒ‚|ˆ _d S t dƒ‚)NztSupported either ``tuple``- (via ``args``) or``dict``- (via ``kwargs``) like input/output, but both types are given.r   c                 3   ó    | ]
}ˆ j t|ƒkV  qd S r)   ©Ú_lengthÚlen©r4   Údatasetr>   r"   r#   r6   ï   ó   € z(StackDataset.__init__.<locals>.<genexpr>zSize mismatch between datasetsc                 3   rD   r)   rE   rH   r>   r"   r#   r6   õ   rJ   z%At least one dataset should be passed)Ú
ValueErrorrG   rF   ÚanyrA   ÚlistÚvalues)r    rB   rC   Útmpr"   r>   r#   r8   é   s   

zStackDataset.__init__c                    s<   t | jtƒr‡ fdd„| j ¡ D ƒS t‡ fdd„| jD ƒƒS )Nc                    s   i | ]	\}}||ˆ  “qS r"   r"   )r4   ÚkrI   r:   r"   r#   Ú
<dictcomp>ý   s    z,StackDataset.__getitem__.<locals>.<dictcomp>c                 3   r9   r)   r"   rH   r:   r"   r#   r6   þ   r;   z+StackDataset.__getitem__.<locals>.<genexpr>)Ú
isinstancerA   ÚdictÚitemsr<   r   r"   r:   r#   r$   û   s   zStackDataset.__getitem__Úindicesc                 C   sj  t | jtƒr[dd„ |D ƒ}| j ¡ D ]F\}}tt|dd ƒƒrH| |¡}t|ƒt|ƒkr9tdt|ƒ› dt|ƒ› ƒ‚t	||ƒD ]\}}|||< q>qt	||ƒD ]
\}}|| ||< qMq|S dd„ |D ƒ}	| jD ]F}tt|dd ƒƒrš| |¡}t|ƒt|ƒkrŠtdt|ƒ› dt|ƒ› ƒ‚t	||	ƒD ]	\}}
|
 
|¡ qqet	||	ƒD ]\}}
|
 
|| ¡ qŸqedd„ |	D ƒ}|S )Nc                 S   s   g | ]}i ‘qS r"   r"   ©r4   Ú_r"   r"   r#   Ú
<listcomp>  ó    z-StackDataset.__getitems__.<locals>.<listcomp>Ú__getitems__z0Nested dataset's output size mismatch. Expected z, got c                 S   s   g | ]}g ‘qS r"   r"   rV   r"   r"   r#   rX     rY   c                 S   s   g | ]}t |ƒ‘qS r"   )r<   )r4   Úsampler"   r"   r#   rX     s    )rR   rA   rS   rT   ÚcallableÚgetattrrZ   rG   rK   ÚzipÚappend)r    rU   Z
dict_batchrP   rI   rT   ÚdataZd_sampleÚidxZ
list_batchZt_sampleZtuple_batchr"   r"   r#   rZ      sH   
ÿÿ
ÿÿ

ÿÿÿÿzStackDataset.__getitems__c                 C   s   | j S r)   )rF   r>   r"   r"   r#   r?   !  s   zStackDataset.__len__)r-   r.   r/   r0   r	   r<   rS   r@   r   r   r8   r$   rM   rZ   r?   r"   r"   r"   r#   r   Ô   s   
 !r   c                       st   e Zd ZU dZeee  ed< ee ed< e	dd„ ƒZ
dee ddf‡ fdd	„Zd
d„ Zdd„ Zedd„ ƒZ‡  ZS )r   zÄDataset as a concatenation of multiple datasets.

    This class is useful to assemble different existing datasets.

    Args:
        datasets (sequence): List of datasets to be concatenated
    rA   Úcumulative_sizesc                 C   s6   g d}}| D ]}t |ƒ}| || ¡ ||7 }q|S r=   )rG   r_   )ÚsequenceÚrÚsÚeÚlr"   r"   r#   Úcumsum1  s   

zConcatDataset.cumsumr   Nc                    sZ   t ƒ  ¡  t|ƒ| _t| jƒdksJ dƒ‚| jD ]}t|tƒr#J dƒ‚q|  | j¡| _d S )Nr   z(datasets should not be an empty iterablez.ConcatDataset does not support IterableDataset)	Úsuperr8   rM   rA   rG   rR   r   rh   rb   )r    rA   Úd©Ú	__class__r"   r#   r8   :  s   


zConcatDataset.__init__c                 C   s
   | j d S )Néÿÿÿÿ)rb   r>   r"   r"   r#   r?   B  ó   
zConcatDataset.__len__c                 C   sf   |dk r| t | ƒkrtdƒ‚t | ƒ| }t | j|¡}|dkr#|}n	|| j|d   }| j| | S )Nr   z8absolute value of index should not exceed dataset lengthé   )rG   rK   ÚbisectÚbisect_rightrb   rA   )r    ra   Zdataset_idxZ
sample_idxr"   r"   r#   r$   E  s   zConcatDataset.__getitem__c                 C   s   t jdtdd | jS )Nz:cummulative_sizes attribute is renamed to cumulative_sizesé   )Ú
stacklevel)ÚwarningsÚwarnÚDeprecationWarningrb   r>   r"   r"   r#   Úcummulative_sizesQ  s   ÿzConcatDataset.cummulative_sizes)r-   r.   r/   r0   r   r   r   r@   ÚintÚstaticmethodrh   r   r8   r?   r$   Úpropertyrw   Ú__classcell__r"   r"   rk   r#   r   %  s   
 
r   c                       s>   e Zd ZdZdee ddf‡ fdd„Zdd„ Zd	d
„ Z‡  Z	S )r   a_  Dataset for chaining multiple :class:`IterableDataset` s.

    This class is useful to assemble different existing dataset streams. The
    chaining operation is done on-the-fly, so concatenating large-scale
    datasets with this class will be efficient.

    Args:
        datasets (iterable of IterableDataset): datasets to be chained together
    rA   r   Nc                    s   t ƒ  ¡  || _d S r)   )ri   r8   rA   )r    rA   rk   r"   r#   r8   c  s   

zChainDataset.__init__c                 c   s.    | j D ]}t|tƒsJ dƒ‚|E d H  qd S )Nú*ChainDataset only supports IterableDataset)rA   rR   r   )r    rj   r"   r"   r#   Ú__iter__g  s
   €
þzChainDataset.__iter__c                 C   s2   d}| j D ]}t|tƒsJ dƒ‚|t|ƒ7 }q|S )Nr   r|   )rA   rR   r   rG   )r    Útotalrj   r"   r"   r#   r?   l  s
   
zChainDataset.__len__)
r-   r.   r/   r0   r   r   r8   r}   r?   r{   r"   r"   rk   r#   r   X  s
    
r   c                   @   sr   e Zd ZU dZee ed< ee ed< dee dee ddfdd„Z	dd	„ Z
dee dee fd
d„Zdd„ ZdS )r   z´
    Subset of a dataset at specified indices.

    Args:
        dataset (Dataset): The whole Dataset
        indices (sequence): Indices in the whole set selected for subset
    rI   rU   r   Nc                 C   s   || _ || _d S r)   ©rI   rU   )r    rI   rU   r"   r"   r#   r8   €  s   
zSubset.__init__c                    s2   t |tƒrˆ j‡ fdd„|D ƒ S ˆ jˆ j|  S )Nc                    ó   g | ]}ˆ j | ‘qS r"   ©rU   )r4   Úir>   r"   r#   rX   †  ó    z&Subset.__getitem__.<locals>.<listcomp>)rR   rM   rI   rU   )r    ra   r"   r>   r#   r$   „  s   
zSubset.__getitem__c                    s>   t tˆ jdd ƒƒrˆ j ‡ fdd„|D ƒ¡S ‡ fdd„|D ƒS )NrZ   c                    r€   r"   r   ©r4   ra   r>   r"   r#   rX     rƒ   z'Subset.__getitems__.<locals>.<listcomp>c                    s   g | ]
}ˆ j ˆ j|  ‘qS r"   r   r„   r>   r"   r#   rX     s    )r\   r]   rI   rZ   )r    rU   r"   r>   r#   rZ   ‰  s   zSubset.__getitems__c                 C   s
   t | jƒS r)   )rG   rU   r>   r"   r"   r#   r?   ‘  rn   zSubset.__len__)r-   r.   r/   r0   r   r   r@   r   rx   r8   r$   r   rZ   r?   r"   r"   r"   r#   r   t  s   
 r   rI   ÚlengthsÚ	generatorr   c           
         s&  t  t|ƒd¡rnt|ƒdkrng }t|ƒD ]$\}}|dk s |dkr(td|› dƒ‚tt  tˆ ƒ| ¡ƒ}| |¡ qtˆ ƒt|ƒ }t	|ƒD ]}|t|ƒ }||  d7  < qE|}t|ƒD ]\}}	|	dkrmt
 d|› d¡ q\t|ƒtˆ ƒkrztdƒ‚tt|ƒ|d ¡ ‰‡ ‡fd	d
„tt|ƒ|ƒD ƒS )aæ  
    Randomly split a dataset into non-overlapping new datasets of given lengths.

    If a list of fractions that sum up to 1 is given,
    the lengths will be computed automatically as
    floor(frac * len(dataset)) for each fraction provided.

    After computing the lengths, if there are any remainders, 1 count will be
    distributed in round-robin fashion to the lengths
    until there are no remainders left.

    Optionally fix the generator for reproducible results, e.g.:

    Example:
        >>> # xdoctest: +SKIP
        >>> generator1 = torch.Generator().manual_seed(42)
        >>> generator2 = torch.Generator().manual_seed(42)
        >>> random_split(range(10), [3, 7], generator=generator1)
        >>> random_split(range(30), [0.3, 0.3, 0.4], generator=generator2)

    Args:
        dataset (Dataset): Dataset to be split
        lengths (sequence): lengths or fractions of splits to be produced
        generator (Generator): Generator used for the random permutation.
    ro   r   zFraction at index z is not between 0 and 1zLength of split at index z- is 0. This might result in an empty dataset.zDSum of input lengths does not equal the length of the input dataset!)r†   c                    s&   g | ]\}}t ˆ ˆ|| |… ƒ‘qS r"   )r   )r4   ÚoffsetÚlengthr   r"   r#   rX   É  s   & z random_split.<locals>.<listcomp>)ÚmathÚiscloseÚsumÚ	enumeraterK   rx   ÚfloorrG   r_   Úrangert   ru   r   Útolistr^   r   )
rI   r…   r†   Zsubset_lengthsr‚   ÚfracZn_items_in_splitÚ	remainderZidx_to_add_atrˆ   r"   r   r#   r   •  s,   ÿ€r   )&rp   rt   r‰   Útypingr   r   r   r   r   r   r   r	   r
   Ztorchr   r   Ztorch._utilsr   Ú r   r   Ú__all__r   r   ÚstrZT_dictZT_tupler   r   r   r   r   r   r   r   rx   Úfloatr   r"   r"   r"   r#   Ú<module>   s4    ,"tQ3"ÿÿ
ÿ